Atlas

Benchmarks

← All benchmarks

Extended NYT Connections 940-Puzzle Set

Games · 2026-02-02

Full 940-puzzle Extended NYT Connections leaderboard from Lech Mazur's public benchmark repository. Scores are percentage-point performance over all 940 extended puzzles, with partial credit and one attempt per puzzle.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview98.4
GPT-5.597.5
Gemini 3 Pro Preview96.3
GPT-5.6 Sol96.1
Kimi K395.8
Gemini 3.5 Flash95.2
Claude Fable 595.1
Opus 4.694.7
Opus 4.894.1
GPT-5.494.0
Grok 4.2093.4
Grok 4.1 Fast91.8
Kimi K2.691.4
Qwen3.7-Max89.8
Muse Spark 1.189.6
GPT-5.288.6
Gemini 3 Flash Preview88.4
Grok 4.586.5
GPT-5.2 Pro85.7
Sonnet 4.685.7
GPT-5.6 Terra84.7
GLM-5.184.4
Sonnet 582.8
Qwen3.6-Max-Preview82.2
GLM-581.8
GLM-5.281.7
Gemma 4 31B IT79.5
GPT-5.6 Luna78.4
Kimi K2.578.3
DeepSeek-V4-Pro75.7
MiniMax M375.3
GPT-5.4 Mini71.8
Qwen3.6 Plus (2026-04-02)71.3
Qwen3.5 397B A17B69.3
Grok 4.367.5
Qwen3.5 122B A10B63.6
Opus 4.562.6
Qwen3.5-27B60.8
Step 3.7 Flash53.6
DeepSeek-V4-Flash53.2
Loading Atlas data…