Atlas

Benchmarks

← All benchmarks

MultiNRC

General QA · 2025-07-23

Score on native multilingual reasoning tasks in French, Spanish, and Chinese.

Top models (higher is better)

ModelScore
Muse Spark 1.165.6
GPT-5 Pro65.2
Gemini 3.1 Pro Preview64.7
GPT-5.4 Pro62.3
Muse Spark59.0
Gemini 3 Pro Preview59.0
GPT-5.458.3
Opus 4.657.1
GPT-552.1
GPT-5.149.0
o3-pro49.0
Opus 4.548.6
o345.5
Gemini 2.5 Pro Preview 06-0545.1
GPT-5.242.2
Opus 4.138.4
Sonnet 4.535.8
Kimi K2.535.2
Opus 433.9
Claude 3.7 Sonnet27.8
DeepSeek-R1-052827.6
Qwen3 235B A22B Thinking 250727.1
Gemini 3.1 Flash-Lite Preview25.0
DeepSeek-R124.3
GPT-5 Mini23.9
DeepSeek-V3.123.6
O4 Mini22.2
GPT-4.121.2
Kimi K2 Instruct18.5
Sonnet 418.4
GPT-5.1 Instant18.3
Qwen3-235B-A22B17.6
GLM-4.517.4
gpt-oss-120b15.2
GPT-4o12.4
GLM 4.5 Air10.4
gpt-oss-20b10.4
Llama 4 Maverick Instruct8.4
Loading Atlas data…