Atlas

Benchmarks

← All benchmarks

MindCube

Multimodal · 2025-06-26

MindCube evaluates whether vision-language models can build spatial mental models from limited multi-view observations. Its 21,154 questions across 3,268 images test cognitive mapping, perspective taking, and mental simulation, and scores are reported as accuracy.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview84.1
Gemini 3.5 Flash83.9
Kimi K383.3
Claude Fable 583.1
Muse Spark 1.180.1
GPT-5.579.9
Gemini 3 Flash Preview78.3
Grok 4.578.1
Gemini 3 Pro Preview77.3
GPT-5.6 Sol76.8
Kimi K2.675.6
Grok 4.372.2
GPT-5.470.4
Grok 4.2067.7
Opus 4.667.0
Opus 4.864.9
Grok 464.7
Opus 4.763.9
GPT-5.6 Terra62.6
GPT-5.162.0
GPT-5.261.7
Opus 4.561.2
GPT-5 Mini61.1
Sonnet 4.660.0
GPT-559.7
Gemini 2.5 Pro59.6
Sonnet 4.558.3
GPT-5.6 Luna57.8
o357.6
GPT-5.4 Mini56.5
Gemini 3.1 Flash-Lite Preview53.9
Gemini 2.5 Flash53.0
Grok 4.1 Fast52.7
O151.2
Grok 4 Fast50.6
Haiku 4.550.4
Gemini 2.5 Flash-Lite Preview 06-1749.2
GPT-5.4 Nano48.9
GPT-4o (2024-11-20)48.1
GPT-5 Nano40.3
Loading Atlas data…