Atlas

Benchmarks

← All benchmarks

MMMU-Pro Standard and Vision Average

Multimodal · 2025-04-05

The arithmetic average of MMMU-Pro Standard and Vision setting scores, as reported in the Llama 4 model card.

Top models (higher is better)

ModelScore
Gemini 3 Deep Think81.5
GPT-5.581.2
Gemini 3 Pro Preview81.0
Gemini 3.1 Pro Preview80.5
GPT-5.279.5
Gemini 3.1 Flash-Lite Preview76.8
GPT-5.176.0
Opus 4.775.2
Sonnet 4.674.5
GPT-5 Mini74.1
Opus 4.673.9
Interfaze Beta71.1
Grok 4.368.7
Gemini 2.5 Pro68.0
Sonnet 4.568.0
Gemini 2.5 Flash66.7
Grok 4.1 Fast63.0
Haiku 4.558.0
Sonnet 553.3
Gemini 2.5 Flash-Lite51.0
GPT-5.4 Mini40.4
Loading Atlas data…