Atlas

Benchmarks

← All benchmarks

MMLU Pro - Other

General QA · 2024-06-03

The Other split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 589.8
Gemini 3.1 Pro Preview88.6
Claude Opus 588.0
Gemini 3 Pro Preview88.0
Opus 4.187.8
GPT-5.6 Sol87.7
Gemini 3.5 Flash87.6
Opus 487.3
Grok 4.587.2
Opus 4.686.9
Opus 4.786.9
Gemini 3 Flash Preview86.9
GPT-5.586.8
Gemini 3.6 Flash86.5
GPT-5.486.5
Opus 4.886.1
MiniMax M2.186.0
Qwen3.7-Max86.0
Sonnet 4.585.8
Qwen3.6 Plus (2026-04-02)85.7
Opus 4.585.5
Sonnet 585.4
Muse Spark 1.185.3
GPT-5.185.0
GPT-585.0
Kimi K2.685.0
Muse Spark84.6
GLM-5.184.5
Grok 484.5
o384.4
Grok 4.2084.3
DeepSeek-V4-Pro84.2
GLM-584.2
Grok 4.384.2
Inkling84.2
GPT-5.6 Terra84.1
Kimi K384.0
GLM-5.283.7
Sonnet 483.5
Kimi K2.583.3
Loading Atlas data…