Atlas

Benchmarks

← All benchmarks

MMLU Pro - Math

Math · 2024-06-03

The Math split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 597.6
Claude Opus 597.1
Gemini 3.5 Flash96.3
Gemini 3.1 Pro Preview96.0
Gemini 3.6 Flash96.0
Gemini 3 Pro Preview96.0
Muse Spark 1.196.0
Qwen3.7-Max96.0
Opus 4.695.9
Sonnet 595.9
Grok 4.595.9
Opus 4.795.9
Opus 4.895.9
GLM-5.295.9
Gemini 3 Flash Preview95.7
Kimi K2.595.7
Kimi K2.695.6
Kimi K395.6
Nemotron 3 Ultra 550B A55B95.6
Qwen3.5 Plus (2026-02-15)95.6
Qwen3 Max Thinking (2026-01-23)95.6
GLM-5.195.5
Qwen3.6 Plus (2026-04-02)95.5
DeepSeek-V4-Pro95.3
GPT-5.6 Sol95.3
Grok 4.2095.1
DeepSeek-V3.295.0
GPT-5.295.0
Muse Spark95.0
Qwen3 Max (rolling alias)95.0
Sonnet 4.595.0
Inkling94.9
Qwen3.5-Flash94.9
Gemini 3.1 Flash-Lite Preview94.8
GLM-594.8
GPT-5.594.7
GPT-594.7
GPT-5.494.7
Opus 4.194.6
MiniMax M394.6
Loading Atlas data…