Atlas

Benchmarks

← All benchmarks

Chess Puzzles

Games · 2025-12-08

Chess-reasoning benchmark with 100 novel engine-generated puzzles. Scores measure whether models identify the correct moves or solutions.

Top models (higher is better)

ModelScore
GPT-5.5 Pro64.0
GPT-5.6 Sol Pro64.0
GPT-5.4 Pro58.6
Gemini 3.1 Pro Preview55.0
GPT-5.6 Sol55.0
GPT-5.554.0
GPT-5.6 Terra54.0
Gemini 3.5 Flash50.0
GPT-5.249.0
GPT-5.444.0
Claude Opus 542.0
Claude Fable 541.0
Gemini 3.6 Flash40.0
GPT-5.6 Luna40.0
Kimi K339.0
Gemini 3 Flash Preview38.0
GPT-537.0
Grok 4.536.0
Sonnet 535.0
Opus 4.834.0
GPT-5.132.0
Gemini 3 Pro Preview31.0
Opus 4.730.0
GPT-5.4 Nano30.0
Grok 428.0
o327.0
Kimi K2.626.0
O4 Mini26.0
Grok 4.325.0
Grok 4.2024.0
Qwen3.7-Max22.0
GLM-5.221.0
Kimi K2.7 Code21.0
DeepSeek-V4-Pro20.0
Gemini 2.5 Pro20.0
gpt-oss-120b20.0
Kimi K2 Thinking20.0
Qwen3.5-Flash20.0
GLM-5.118.0
GPT-5.4 Mini18.0
Loading Atlas data…