Atlas

Benchmarks

← All benchmarks

MMLU Pro - Computer Science

General QA · 2024-06-03

The Computer Science split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 594.1
Claude Opus 593.9
Opus 4.792.7
Opus 4.892.7
Gemini 3.1 Pro Preview92.7
Gemini 3.5 Flash91.7
Gemini 3.6 Flash91.7
Gemini 3 Pro Preview91.5
Kimi K2.691.2
Kimi K391.2
Qwen3.7-Max91.2
Gemini 3 Flash Preview91.0
GPT-5.6 Terra91.0
Grok 4.591.0
Qwen3.5 Plus (2026-02-15)91.0
Opus 4.690.7
GPT-5.6 Sol90.7
Muse Spark 1.190.7
GLM-5.290.2
Sonnet 4.690.0
Muse Spark90.0
GPT-5.189.8
GPT-5.489.8
GPT-5.589.8
GPT-5.6 Luna89.8
Nemotron 3 Ultra 550B A55B89.8
Qwen3.6 Plus (2026-04-02)89.8
Opus 4.189.5
Sonnet 4.589.5
GLM-5.189.5
Sonnet 589.0
DeepSeek-V4-Pro89.0
Gemini 3.1 Flash-Lite Preview89.0
Grok 4.389.0
Kimi K2.589.0
Inkling88.5
Qwen3 Max Thinking (2026-01-23)88.5
Opus 488.3
GPT-5.288.3
MiniMax M388.3
Loading Atlas data…