MindCube
Multimodal · 2025-06-26
MindCube evaluates whether vision-language models can build spatial mental models from limited multi-view observations. Its 21,154 questions across 3,268 images test cognitive mapping, perspective taking, and mental simulation, and scores are reported as accuracy.
Top models (higher is better)
| Model | Score |
|---|---|
| Gemini 3.1 Pro Preview | 84.1 |
| Gemini 3.5 Flash | 83.9 |
| Kimi K3 | 83.3 |
| Claude Fable 5 | 83.1 |
| Muse Spark 1.1 | 80.1 |
| GPT-5.5 | 79.9 |
| Gemini 3 Flash Preview | 78.3 |
| Grok 4.5 | 78.1 |
| Gemini 3 Pro Preview | 77.3 |
| GPT-5.6 Sol | 76.8 |
| Kimi K2.6 | 75.6 |
| Grok 4.3 | 72.2 |
| GPT-5.4 | 70.4 |
| Grok 4.20 | 67.7 |
| Opus 4.6 | 67.0 |
| Opus 4.8 | 64.9 |
| Grok 4 | 64.7 |
| Opus 4.7 | 63.9 |
| GPT-5.6 Terra | 62.6 |
| GPT-5.1 | 62.0 |
| GPT-5.2 | 61.7 |
| Opus 4.5 | 61.2 |
| GPT-5 Mini | 61.1 |
| Sonnet 4.6 | 60.0 |
| GPT-5 | 59.7 |
| Gemini 2.5 Pro | 59.6 |
| Sonnet 4.5 | 58.3 |
| GPT-5.6 Luna | 57.8 |
| o3 | 57.6 |
| GPT-5.4 Mini | 56.5 |
| Gemini 3.1 Flash-Lite Preview | 53.9 |
| Gemini 2.5 Flash | 53.0 |
| Grok 4.1 Fast | 52.7 |
| O1 | 51.2 |
| Grok 4 Fast | 50.6 |
| Haiku 4.5 | 50.4 |
| Gemini 2.5 Flash-Lite Preview 06-17 | 49.2 |
| GPT-5.4 Nano | 48.9 |
| GPT-4o (2024-11-20) | 48.1 |
| GPT-5 Nano | 40.3 |