Atlas

Benchmarks

← All benchmarks

MMMU Pro

Multimodal · 2024-09-04

MMMU-Pro is a more robust version of MMMU that removes text-only-answerable items, expands the candidate options, and adds a vision-only input setting. Scores are reported as answer accuracy.

Top models (higher is better)

ModelScore
Claude Opus 584.7
Gemini 3.5 Flash84.3
Gemini 3.6 Flash83.2
GPT-5.6 Sol82.7
Claude Fable 581.2
GPT-5.581.2
GPT-5.6 Terra80.7
Muse Spark80.5
Qwen3.7-Plus80.5
Grok 4.580.4
Gemini 3 Pro Preview80.2
Gemini 3 Flash Preview79.9
Kimi K2.679.4
Gemini 3.5 Flash-Lite79.0
Opus 4.878.9
Opus 4.778.8
GPT-5.6 Luna78.6
MiniMax M378.6
GPT-5.3-Codex78.5
Kimi K378.5
Grok 4.378.1
GPT-5.478.0
Qwen3.6 Plus (2026-04-02)78.0
Sonnet 577.3
Qwen3.5 397B A17B77.3
Grok Build 0.176.5
GPT-5.2-Codex76.3
Gemini 3.1 Flash-Lite Preview75.5
GPT-5.175.5
MiMo-V2.575.4
Kimi K2.575.4
Step 3.7 Flash75.3
Qwen3.5-27B75.0
Qwen3.6 35B A3B75.0
Qwen3.5 122B A10B75.0
Gemini 2.5 Pro74.9
Qwen3.6 27B74.6
GPT-5.274.6
Grok 4.2074.6
Sonnet 4.674.5
Loading Atlas data…