Atlas

Benchmarks

← All benchmarks

A-Fantasia

General QA · 2025-04-27

A-Fantasia evaluates mental-imagery-like capability with 300 immediate-answer trials across legal chess moves, 3D cube rotations, and backwards spelling from definitions. Its headline score is the mean error rate across the three 100-item tasks, so lower scores indicate better performance.

Top models (lower is better)

ModelScore
Opus 4.630.0
GPT-5.534.7
Opus 4.535.3
Opus 4.135.3
GPT-5.6 Sol36.0
GPT-4.537.7
Gemini 3 Flash Preview38.3
Gemini 3.1 Pro Preview40.0
Sonnet 4.540.3
Opus 440.3
Gemini 3 Pro Preview41.7
GPT-5.442.3
GPT-5.6 Terra43.3
Sonnet 444.0
Claude 3.7 Sonnet45.3
Claude 3.5 Sonnet (Oct 2024)46.0
Qwen3.7-Max46.0
Grok 347.0
GPT-4o48.0
Gemini 2.5 Pro49.0
Opus 4.850.0
Opus 350.3
GPT-5.151.0
GPT-5.251.3
GPT-5 Chat (2025-08-07)51.7
Gemini 2.0 Flash 00152.3
Sonnet 4.652.3
GPT-4.153.0
Gemini 3.1 Flash-Lite53.3
Gemini 2.5 Flash55.3
DeepSeek-V4-Pro56.7
GPT-5.6 Luna56.7
Qwen3.6 Plus (2026-04-02)58.0
Kimi K2.660.0
Qwen3.7-Plus61.7
Gemini 1.5 Pro62.3
Inkling64.7
Gemini 2.0 Flash-Lite 00165.0
Qwen3 Max (rolling alias)66.0
GLM-566.7
Loading Atlas data…