Atlas

Benchmarks

← All benchmarks

MMLU Pro

General QA · 2024-06-03

Accuracy on the 14-subject MMLU Pro academic benchmark.

Top models (higher is better)

ModelScore
Gemini 3 Pro Preview89.8
Opus 4.589.5
Gemini 3 Flash Preview88.2
Opus 4.188.0
MiniMax M2.187.5
GPT-5.287.4
Opus 487.3
Grok 486.6
GPT-5-Codex86.5
DeepSeek-V3.2-Speciale86.3
DeepSeek-V3.286.2
GPT-5.1-Codex86.0
Sonnet 4.586.0
Gemini 2.5 Pro85.8
Doubao-Seed-Code85.4
Grok 4.1 Fast85.4
o385.3
DeepSeek-V3.1-Terminus85.1
DeepSeek-V3.2-Exp85.0
Grok 4 Fast85.0
Cogito v2.1 671B84.9
Kimi K2 Thinking84.8
DeepSeek-R184.4
MiMo-V2-Flash84.3
Gemini 2.5 Flash Preview (09-2025)84.2
Qwen3-Max (2025-09-23)84.1
O184.1
Qwen3 Max Preview83.8
K-EXAONE 236B-A23B83.8
Gemini 2.5 Pro Preview 05-0683.7
Claude 3.7 Sonnet83.7
Qwen3 VL 235B A22B Thinking83.6
GLM-4.583.5
O4 Mini83.2
Gemini 2.5 Flash83.2
ERNIE 5.083.0
Nova 2 Pro (Preview)83.0
GLM 4.682.9
Hermes 4 405B82.9
Qwen3-235B-A22B82.8
Loading Atlas data…