Atlas

Benchmarks

← All benchmarks

MMLU Pro - Economics

General QA · 2024-06-03

The Economics split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 593.8
Claude Opus 593.7
Gemini 3.1 Pro Preview93.4
Opus 4.792.3
Gemini 3.5 Flash91.9
Gemini 3 Pro Preview91.9
Opus 4.891.8
Qwen3.7-Max91.7
Kimi K391.6
Grok 4.591.4
Muse Spark 1.191.2
Gemini 3 Flash Preview91.0
Sonnet 4.690.6
GPT-5.6 Sol90.6
Gemini 3.6 Flash90.5
GLM-5.290.4
Opus 4.690.3
MiniMax M2.190.3
Sonnet 4.590.2
Grok 4.390.2
Opus 4.190.1
GPT-5.589.9
Kimi K2.689.9
Gemini 3.5 Flash-Lite89.8
Inkling89.8
Muse Spark89.8
Opus 489.7
GPT-5.489.7
Grok 4.2089.7
Qwen3.5 Plus (2026-02-15)89.7
Qwen3.6 Plus (2026-04-02)89.7
Opus 4.589.6
GPT-5.289.6
GPT-589.6
Sonnet 589.5
Gemini 3.1 Flash-Lite Preview89.3
Qwen3.5-Flash89.3
GLM-5.189.0
GPT-5.189.0
GPT-5.6 Terra89.0
Loading Atlas data…