Atlas

Benchmarks

← All benchmarks

MMLU Pro - Chemistry

General QA · 2024-06-03

The Chemistry split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 593.9
Muse Spark 1.193.4
Opus 4.693.3
Opus 4.793.3
Claude Opus 593.3
Gemini 3.1 Pro Preview93.3
Gemini 3.5 Flash93.1
Opus 4.892.8
Gemini 3 Pro Preview92.8
DeepSeek-V4-Pro92.5
Kimi K2.692.5
Gemini 3.6 Flash92.3
Qwen3.7-Max92.3
Qwen3.5 Plus (2026-02-15)92.2
GPT-5.6 Sol92.0
Sonnet 4.691.9
Gemini 3 Flash Preview91.9
GLM-5.191.8
Kimi K391.8
Nemotron 3 Ultra 550B A55B91.7
GLM-5.291.6
Grok 4.391.6
Grok 4.591.6
Muse Spark91.5
Qwen3.6 Plus (2026-04-02)91.4
Inkling91.3
MiniMax M2.191.3
GPT-5.591.3
Kimi K2.591.3
Sonnet 4.591.1
GPT-5.491.1
Qwen3.5-Flash91.1
Gemini 3.1 Flash-Lite Preview91.0
Gemini 3.5 Flash-Lite91.0
GPT-5.6 Luna91.0
Qwen3 Max Thinking (2026-01-23)91.0
Opus 4.190.9
Opus 4.590.8
Sonnet 590.8
GLM-590.8
Loading Atlas data…