Blueprint-Bench 2
Multimodal · 2026-05-04
Blueprint-Bench 2 evaluates spatial reasoning by asking persistent agents to reconstruct floor plans for 50 apartments from approximately 20 photographs each. Published scores normalize connectivity similarity so the random baseline is zero and perfect reconstruction is one.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 0.4 |
| GPT-5.5 | 0.4 |
| GPT-5.6 Sol | 0.3 |
| Gemini 3.5 Flash | 0.3 |
| Gemini 3.6 Flash | 0.3 |
| GPT-5.6 Terra | 0.3 |
| Claude Opus 5 | 0.3 |
| Kimi K3 | 0.3 |
| Grok 4.5 | 0.3 |
| GPT-5.4 | 0.3 |
| Gemini 3.1 Pro Preview | 0.3 |
| Opus 4.7 | 0.2 |
| GPT-5.6 Luna | 0.2 |
| Opus 4.8 | 0.1 |
| Sonnet 4.6 | 0.1 |
| Kimi K2.6 | 0.0 |
| Haiku 4.5 | 0.0 |
| Gemini 3 Flash Preview | 0.0 |
| Grok 4.20 | 0.0 |
| Grok 4.3 | 0.0 |