Atlas

Benchmarks

← All benchmarks

Opus Magnum Campaign

Games · 2026-06-17

Campaign benchmark score across all 36 Opus Magnum puzzles, normalized to human-best sum scores.

Top models (higher is better)

ModelScore
GPT-5.6 Sol70.9
Claude Fable 560.2
GPT-5.553.9
GPT-5.6 Terra47.7
Gemini 3.1 Pro Preview31.1
Sonnet 526.5
GLM-5.225.4
Gemini 3.5 Flash24.5
Opus 4.822.8
Grok 4.518.2
GPT-5.6 Luna17.8
Gemini 3 Flash Preview15.4
DeepSeek-V4-Pro13.4
Sonnet 4.612.4
Kimi K2.7 Code10.9
GLM-5.110.8
GPT-5.4 Mini9.2
GPT-5.4 Nano6.5
Kimi K2.65.5
Grok 4.30.0
Loading Atlas data…