Atlas

Benchmarks

← All benchmarks

MMMLU

General QA · 2024-03-04

Multilingual MMLU benchmark based on translated MMLU questions.

Top models (higher is better)

ModelScore
Claude Mythos Preview92.7
Gemini 3.1 Pro Preview92.6
Gemini 3 Pro Preview91.8
Opus 4.791.5
Opus 4.691.1
GPT-5.191.0
Interfaze Beta90.9
Opus 4.590.8
Grok 4.389.7
GPT-5.289.6
Gemini 2.5 Pro89.5
Sonnet 4.689.3
Sonnet 4.589.1
Gemini 3.1 Flash-Lite Preview88.9
Gemini 3.5 Flash88.1
Sonnet 587.3
Grok 4.1 Fast86.8
Gemini 2.5 Flash86.6
GPT-5 Mini84.9
Gemini 2.5 Flash-Lite84.5
Haiku 4.583.0
Opus 379.1
GPT-5.4 Mini75.3
Claude 3 Sonnet69.0
Claude 3 Haiku65.2
Loading Atlas data…