Atlas

Benchmarks

← All benchmarks

AIME 2025 (avg@8)

Math · 2025-02-12

AIME 2025 accuracy averaged across eight sampled solutions per problem, separated from single-attempt results.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview97.1
Muse Spark97.1
GPT-5.296.7
GPT-5.496.3
Opus 4.795.8
Gemini 3 Flash Preview95.4
GPT-5.4 Mini95.4
Gemini 3 Pro Preview94.2
Grok 4.2094.2
Opus 4.693.8
Kimi K2.593.8
Qwen3.6 Plus (2026-04-02)93.8
GPT-5.192.9
GPT-592.6
GPT-5.4 Nano92.1
gpt-oss-120b92.1
GLM-4.791.7
GLM-5.191.7
Qwen3.5-Flash91.7
Opus 4.591.3
Sonnet 4.691.3
GLM 4.690.8
Grok 4.1 Fast90.4
MiniMax M2.790.4
GLM-590.0
GPT-5 Mini90.0
Grok 4 Fast88.3
MiniMax M2.588.3
Grok 487.8
GLM-4.586.3
Sonnet 4.585.7
gpt-oss-20b85.4
Kimi K2 Thinking85.0
Gemini 2.5 Pro Experimental 03-2584.2
o3-mini83.8
Qwen3.5 Plus (2026-02-15)83.8
o383.3
Qwen3-235B-A22B83.3
O4 Mini82.7
Haiku 4.581.7
Loading Atlas data…