Atlas

Benchmarks

← All benchmarks

MMLU

General QA · 2020-09-07

MMLU (Measuring Massive Multitask Language Understanding) is a multiple-choice benchmark spanning 57 subjects across STEM, the humanities, the social sciences, and more. It measures broad world knowledge and problem-solving, typically reported as average accuracy. Higher scores indicate better performance.

Top models (higher is better)

ModelScore
Claude 3.5 Sonnet (June 2024)88.7
Claude 3.5 Sonnet (Oct 2024)88.7
Opus 388.2
Claude 3 Sonnet81.5
Gemini 1.5 Flash78.9
PaLM 2-L78.4
Haiku 3.577.6
Claude 3 Haiku76.7
Grok 173.0
Gemini 1.5 Flash-8B68.1
Gemini Nano 255.8
Gemini Nano 145.9
Loading Atlas data…