Atlas

Benchmarks

← All benchmarks

MMLU Pro - Health

General QA · 2024-06-03

The Health split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 587.8
Gemini 3.1 Pro Preview86.4
Opus 4.885.1
Opus 4.185.0
Claude Fable 584.6
Opus 4.584.6
Opus 4.684.6
Gemini 3.6 Flash84.6
GPT-5.584.4
Qwen3.7-Max84.4
GPT-5.6 Sol84.1
Opus 484.0
Grok 4.584.0
MiniMax M2.183.7
Gemini 3.5 Flash83.6
Gemini 3 Pro Preview83.6
Muse Spark 1.183.4
GPT-5.6 Terra82.8
Gemini 3 Flash Preview82.6
Grok 4.382.6
Opus 4.782.4
Sonnet 4.682.4
DeepSeek-V4-Pro82.4
GPT-5.482.4
Sonnet 582.3
Sonnet 4.582.0
Kimi K382.0
Grok 481.7
GLM-5.181.5
GLM-5.281.4
GPT-5.6 Luna81.4
GPT-5.281.2
GPT-5.180.9
Grok 4.2080.9
GPT-580.8
Kimi K2.580.8
Muse Spark80.8
Qwen3.6 Plus (2026-04-02)80.8
Sonnet 480.7
Kimi K2.680.7
Loading Atlas data…