Atlas

Benchmarks

← All benchmarks

MMLU Pro - History

General QA · 2024-06-03

The History split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 586.6
Gemini 3.1 Pro Preview85.6
Claude Fable 585.3
Gemini 3 Pro Preview84.8
Gemini 3.6 Flash83.5
Opus 4.783.2
Opus 4.682.7
Opus 4.882.7
Opus 4.182.4
Qwen3.7-Max82.2
Sonnet 4.581.9
GPT-5.6 Sol81.9
Gemini 3.5 Flash81.6
GPT-5.581.6
Grok 4.581.4
Sonnet 4.681.1
Qwen3.6 Plus (2026-04-02)81.1
Gemini 3 Flash Preview80.8
Muse Spark80.8
Opus 480.3
Opus 4.580.3
Sonnet 580.3
Muse Spark 1.179.8
GPT-5.6 Terra79.5
MiniMax M2.179.5
Sonnet 479.3
GPT-5.479.3
GPT-579.3
Kimi K379.3
Qwen3.5 Plus (2026-02-15)78.7
Gemini 3.5 Flash-Lite78.5
Kimi K2.678.5
GLM-5.178.4
Gemini 3.1 Flash-Lite Preview78.2
Grok 4.378.0
o378.0
DeepSeek-V4-Pro77.7
GPT-5.177.7
GLM-577.4
Grok 4.2077.4
Loading Atlas data…