Atlas

Benchmarks

← All benchmarks

Eval Connections One-Shot Group Accuracy

Games · 2026-07-22

Percentage of 80 canonical word groups recovered across 20 Eval Connections one-shot submissions. No correctness feedback; current structural-format repair allowance is two turns. Correlated component of the one-shot points metric.

Top models (higher is better)

ModelScore
GPT-6 Astra100.0
Muse Spark 1.1100.0
Gemini 3.8 Flash100.0
Claude Opus 5.5100.0
Gemini 3.1 Pro Preview100.0
GPT-5.6 Terra100.0
Gemini 3 Flash Preview100.0
GPT-5.6 Sol Pro100.0
Fugu Ultra v1.0100.0
Grok 4.20100.0
Gemini 3.7 Flash100.0
DeepSeek V4 Pro 0813100.0
GLM-5.3 Flash100.0
Claude Opus 5100.0
Grok 4.697.5
GPT-6 Sol97.5
Claude Fable 597.5
Grok 4.797.5
GPT-5.6 Terra Pro97.5
Muse Spark 1.396.3
Claude Fable 5.196.3
Muse Spark 1.296.3
DeepSeek-V4-Flash-073195.0
Qwen3.8 Flash95.0
Gemini 3.6 Flash95.0
Opus 4.795.0
Kimi K392.5
Grok 4.592.5
Opus 4.592.5
GPT-5.6 Luna Pro91.3
GPT-5.6 Sol90.0
Sonnet 588.8
GLM 5V Turbo87.5
DeepSeek V4.1 Flash87.5
Gemini 3.5 Flash-Lite86.3
Gemini 3.5 Flash85.0
GLM-5.385.0
Inkling83.8
MiMo-V2.6-Flash82.5
GPT-6 Luna81.3
Loading Atlas data…