Atlas

Benchmarks

← All benchmarks

MMLU Pro - Business

General QA · 2024-06-03

The Business split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Muse Spark 1.194.5
Gemini 3 Pro Preview93.7
Claude Opus 593.5
Qwen3.7-Max93.5
Gemini 3.1 Pro Preview93.4
Opus 4.793.3
Gemini 3.5 Flash93.3
GPT-5.6 Sol93.3
Grok 4.593.3
Claude Fable 593.2
Grok 4.392.9
Gemini 3.6 Flash92.8
Opus 4.892.6
Gemini 3 Flash Preview92.3
Qwen3.6 Plus (2026-04-02)92.3
Qwen3.5 Plus (2026-02-15)92.1
GPT-5.592.0
Kimi K392.0
Sonnet 4.591.9
Sonnet 4.691.9
DeepSeek-V4-Pro91.9
GLM-5.291.9
Muse Spark91.9
GPT-5.491.8
Sonnet 591.6
GPT-5.291.6
Kimi K2.691.6
Grok 491.5
Inkling91.5
Gemini 3.1 Flash-Lite Preview91.4
GPT-591.4
Grok 4.2091.4
Opus 4.191.1
GLM-5.191.1
GPT-5.6 Luna91.0
Nemotron 3 Ultra 550B A55B91.0
Qwen3 Max Thinking (2026-01-23)91.0
GPT-5.6 Terra90.9
GLM-590.7
Kimi K2.590.7
Loading Atlas data…