Atlas

Benchmarks

← All benchmarks

ZeroEval MMLU-Redux

General QA · 2024-08-01

MMLU-Redux evaluated with the ZeroEval zero-shot prompt format, greedy decoding, and answer parser.

Top models (higher is better)

ModelScore
o1 Preview92.8
Claude 3.5 Sonnet (Oct 2024)88.9
ChatGPT-4o Latest (September 2024 benchmark entry)88.9
GPT-4o (2024-08-06)88.3
GPT-4o88.0
Grok 2 121287.4
o1-mini86.7
Llama 3.1 405B Instruct86.2
Gemini 1.5 Pro Experimental 082786.1
Claude 3.5 Sonnet (June 2024)86.0
Qwen2.5 72B Instruct85.6
Gemini 1.5 Pro Experimental 080185.5
GPT-4 Turbo85.3
Qwen2.5 Instruct 32B83.7
Llama 3.1 70B Instruct83.0
Mistral Large 2 (Instruct 2407)83.0
Gemini 1.5 Pro82.8
Opus 382.5
Yi-Large82.2
Gemini 1.5 Flash Experimental 082782.1
GPT-481.6
Qwen2 72B Instruct81.6
GPT-4o Mini81.5
DeepSeek-V2-Chat-062880.8
DeepSeek-V2.580.3
DeepSeek-Coder-V2-Instruct-072480.2
DeepSeek-Coder-V2-Instruct79.6
Haiku 3.579.6
Llama 3 70B Instruct78.0
Gemini 1.5 Flash77.4
Athene-70B76.6
Reka Core 20240501 (ZeroEval label)76.4
Gemma 2 27B IT75.7
Qwen2.5 7B Instruct75.1
Claude 3 Sonnet74.9
Gemma 2 9B IT72.8
Yi 1.5 34B Chat72.8
Claude 3 Haiku72.3
Phi-3-mini-4k-instruct70.3
C4AI Command R+68.6
Loading Atlas data…