Atlas

Benchmarks

← All benchmarks

A-Fantasia Chess

Games · 2025-04-26

A-Fantasia Chess asks for a Standard Algebraic Notation move after a randomly generated legal move sequence. A response is correct when it names any legal move in the resulting position; scores are error rates over 100 trials, so lower is better.

Top models (lower is better)

ModelScore
GPT-4.53.0
GPT-5 Chat (2025-08-07)11.0
Gemini 2.0 Flash 00112.0
GPT-4o13.0
GPT-4.113.0
GPT-5.514.0
Gemini 3.1 Pro Preview16.0
Qwen3.7-Max16.0
Gemini 2.5 Pro16.0
GPT-5.116.0
Opus 4.119.0
Opus 4.620.0
Opus 4.522.0
GPT-5.6 Sol22.0
GPT-5.6 Terra22.0
Gemini 2.0 Flash-Lite 00122.0
Sonnet 4.525.0
GPT-5.6 Luna25.0
Sonnet 4.626.0
Gemini 3.1 Flash-Lite26.0
Gemini 2.5 Flash27.0
Grok 328.0
Opus 429.0
Sonnet 429.0
Kimi K2.629.0
Gemini 3 Flash Preview30.0
Gemini 3 Pro Preview30.0
Opus 4.831.0
GPT-5.433.0
Claude 3.7 Sonnet33.0
Qwen3.6 Plus (2026-04-02)33.0
Llama 3.3 70B Instruct34.0
Claude 3.5 Sonnet (Oct 2024)35.0
Gemini 1.5 Pro35.0
Llama 3.1 405B Instruct38.0
Opus 342.0
GPT-5.242.0
Qwen3 Max (rolling alias)43.0
DeepSeek-V4-Pro44.0
Qwen3.7-Plus45.0
Loading Atlas data…