MMMU-Pro Standard and Vision Average
Multimodal · 2025-04-05
The arithmetic average of MMMU-Pro Standard and Vision setting scores, as reported in the Llama 4 model card.
Top models (higher is better)
| Model | Score |
|---|---|
| Gemini 3 Deep Think | 81.5 |
| GPT-5.5 | 81.2 |
| Gemini 3 Pro Preview | 81.0 |
| Gemini 3.1 Pro Preview | 80.5 |
| GPT-5.2 | 79.5 |
| Gemini 3.1 Flash-Lite Preview | 76.8 |
| GPT-5.1 | 76.0 |
| Opus 4.7 | 75.2 |
| Sonnet 4.6 | 74.5 |
| GPT-5 Mini | 74.1 |
| Opus 4.6 | 73.9 |
| Interfaze Beta | 71.1 |
| Grok 4.3 | 68.7 |
| Gemini 2.5 Pro | 68.0 |
| Sonnet 4.5 | 68.0 |
| Gemini 2.5 Flash | 66.7 |
| Grok 4.1 Fast | 63.0 |
| Haiku 4.5 | 58.0 |
| Sonnet 5 | 53.3 |
| Gemini 2.5 Flash-Lite | 51.0 |
| GPT-5.4 Mini | 40.4 |