Atlas

Benchmarks

← All benchmarks

EnigmaEval

General QA · 2025-02-13

Score on puzzle-hunt reasoning tasks with multimodal clues.

Top models (higher is better)

ModelScore
GPT-5.537.2
GPT-5.427.6
Gemini 3.5 Flash25.4
Kimi K323.6
Opus 4.823.5
GPT-5.6 Terra23.1
GPT-5.6 Luna19.1
Gemini 3 Flash Preview18.3
Gemini 3 Pro Preview17.8
Grok 4.517.0
Muse Spark 1.116.6
Opus 4.715.6
GPT-5.214.5
Opus 4.512.4
o311.9
GPT-5.111.7
GPT-510.5
O4 Mini9.2
Sonnet 4.69.1
GPT-5 Mini8.2
Grok 47.8
Grok 4.207.7
Opus 4.67.6
GPT-5.4 Mini6.9
Grok 4.36.1
Sonnet 4.56.0
O15.7
Gemini 2.5 Pro5.6
Kimi K2.65.5
Grok 4.1 Fast5.2
GPT-5.4 Nano4.9
Grok 4 Fast4.7
Gemini 3.1 Flash-Lite Preview4.6
GPT-5 Nano2.9
Gemini 2.5 Flash2.7
Haiku 4.52.3
Sonnet 42.2
Gemini 2.5 Flash-Lite Preview 06-170.8
GPT-4o (2024-11-20)0.8
Loading Atlas data…