Atlas

Benchmarks

← All benchmarks

Eval Connections One-Shot Puzzle Solves

Games · 2026-07-22

Percentage of the 20 canonical Eval Connections puzzles with all four groups correct under the one-shot trap protocol. No correctness feedback; structural-format repairs are permitted by the current harness. Trap correctness is scored separately.

Top models (higher is better)

ModelScore
GPT-6 Astra100.0
Muse Spark 1.1100.0
Gemini 3.8 Flash100.0
Claude Opus 5.5100.0
Gemini 3.1 Pro Preview100.0
GPT-5.6 Terra100.0
Gemini 3 Flash Preview100.0
GPT-5.6 Sol Pro100.0
Fugu Ultra v1.0100.0
Grok 4.20100.0
Gemini 3.7 Flash100.0
DeepSeek V4 Pro 0813100.0
GLM-5.3 Flash100.0
Claude Opus 5100.0
Grok 4.695.0
GPT-6 Sol95.0
Claude Fable 595.0
Grok 4.795.0
Muse Spark 1.395.0
Claude Fable 5.195.0
Muse Spark 1.295.0
GPT-5.6 Terra Pro95.0
DeepSeek-V4-Flash-073195.0
Qwen3.8 Flash95.0
Gemini 3.6 Flash95.0
Opus 4.795.0
Kimi K390.0
Grok 4.590.0
Opus 4.590.0
GPT-5.6 Sol85.0
DeepSeek V4.1 Flash85.0
GPT-5.6 Luna Pro85.0
Gemini 3.5 Flash85.0
GLM-5.385.0
GLM 5V Turbo80.0
Sonnet 580.0
Gemini 3.5 Flash-Lite80.0
Inkling80.0
MiMo-V2.6-Flash75.0
GPT-5.6 Luna70.0
Loading Atlas data…