Atlas

Benchmarks

← All benchmarks

MMLU Pro - Philosophy

General QA · 2024-06-03

The Philosophy split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 590.6
Gemini 3.1 Pro Preview90.4
Opus 4.589.4
Qwen3.7-Max89.2
Opus 4.789.0
Claude Opus 589.0
Gemini 3 Pro Preview89.0
Opus 4.688.4
GPT-5.6 Sol88.4
Opus 4.188.2
GPT-5.587.8
Gemini 3.5 Flash87.6
Gemini 3.6 Flash87.6
Grok 4.587.6
Muse Spark 1.187.2
Qwen3.6 Plus (2026-04-02)87.2
GPT-5.487.0
Grok 4.386.8
Opus 4.886.6
Sonnet 586.6
Sonnet 4.686.2
GPT-586.2
Sonnet 4.586.0
GPT-5.186.0
MiniMax M2.186.0
Opus 485.6
GPT-5.285.6
Qwen3.5 Plus (2026-02-15)85.6
Gemini 3 Flash Preview85.4
Kimi K385.4
Muse Spark85.4
o385.2
DeepSeek-V4-Pro84.6
Kimi K2.684.6
GLM-5.284.2
GPT-5.6 Terra84.0
GLM-5.183.9
Grok 483.4
Grok 4.2083.4
GLM-583.2
Loading Atlas data…