Atlas

Benchmarks

← All benchmarks

EnigmaEval

General QA · 2025-02-13

Score on puzzle-hunt reasoning tasks with multimodal clues.

Top models (higher is better)

ModelScore
GPT-5.537.2
GPT-5.427.6
Gemini 3.5 Flash25.4
Kimi K323.6
Opus 4.823.5
GPT-5.6 Terra23.1
Gemini 3.1 Pro Preview19.8
GPT-5.6 Luna19.1
Gemini 3 Flash Preview18.3
Gemini 3 Pro Preview18.2
Grok 4.517.0
Muse Spark 1.116.6
Opus 4.715.6
GPT-5.214.5
o313.1
Opus 4.512.4
GPT-5.111.7
GPT-510.5
O4 Mini9.2
Sonnet 4.69.1
GPT-5 Mini8.2
Grok 47.8
Grok 4.207.7
Opus 4.67.6
Opus 4.17.2
GPT-5.4 Mini6.9
O1 Pro6.1
Grok 4.36.1
Sonnet 4.56.0
O15.7
Gemini 2.5 Pro5.6
Opus 45.6
Gemini 2.5 Pro Preview 06-055.6
Kimi K2.65.5
Grok 4.1 Fast5.2
GPT-5.4 Nano4.9
Grok 4 Fast4.7
Gemini 3.1 Flash-Lite Preview4.6
Claude 3.7 Sonnet4.2
Gemini 2.5 Pro Experimental 03-254.1
Loading Atlas data…