Atlas

Benchmarks

← All benchmarks

MMLU Pro - Psychology

General QA · 2024-06-03

The Psychology split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 592.5
Claude Fable 592.2
Gemini 3.1 Pro Preview92.0
Opus 4.791.2
Gemini 3 Pro Preview91.0
Gemini 3.5 Flash90.4
Grok 4.590.2
Opus 4.890.0
Qwen3.7-Max90.0
Opus 4.689.8
Gemini 3.6 Flash89.5
Opus 4.189.3
GPT-5.6 Sol89.2
Kimi K2.689.2
Gemini 3 Flash Preview88.8
Opus 4.588.7
Sonnet 588.7
GPT-5.588.5
Kimi K388.3
Opus 488.2
DeepSeek-V4-Pro88.0
MiniMax M2.188.0
Sonnet 4.587.8
GPT-5.487.8
Grok 4.387.7
GPT-587.5
Qwen3.6 Plus (2026-04-02)87.5
Sonnet 4.687.3
GLM-5.187.2
Muse Spark 1.187.2
GPT-5.187.1
Qwen3.5 Plus (2026-02-15)87.0
Inkling86.6
Muse Spark86.5
o386.5
GPT-5.6 Terra86.3
GLM-5.286.2
GPT-5.286.1
Kimi K2.586.1
MiMo-V2.5-Pro86.1
Loading Atlas data…