MMMLU
General QA · 2024-03-04
Multilingual MMLU benchmark based on translated MMLU questions.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Mythos Preview | 92.7 |
| Gemini 3.1 Pro Preview | 92.6 |
| Gemini 3 Pro Preview | 91.8 |
| Opus 4.7 | 91.5 |
| Opus 4.6 | 91.1 |
| GPT-5.1 | 91.0 |
| Interfaze Beta | 90.9 |
| Opus 4.5 | 90.8 |
| Grok 4.3 | 89.7 |
| GPT-5.2 | 89.6 |
| Gemini 2.5 Pro | 89.5 |
| Sonnet 4.6 | 89.3 |
| Sonnet 4.5 | 89.1 |
| Gemini 3.1 Flash-Lite Preview | 88.9 |
| Gemini 3.5 Flash | 88.1 |
| Sonnet 5 | 87.3 |
| Grok 4.1 Fast | 86.8 |
| Gemini 2.5 Flash | 86.6 |
| GPT-5 Mini | 84.9 |
| Gemini 2.5 Flash-Lite | 84.5 |
| Haiku 4.5 | 83.0 |
| Opus 3 | 79.1 |
| GPT-5.4 Mini | 75.3 |
| Claude 3 Sonnet | 69.0 |
| Claude 3 Haiku | 65.2 |