ERQA
Multimodal · 2025-03-25
Embodied reasoning QA benchmark for spatial and action reasoning.
Top models (higher is better)
| Model | Score |
|---|---|
| Gemini 3.5 Flash | 75.4 |
| Gemini 3.1 Pro Preview | 74.2 |
| GPT-5.6 Sol | 71.2 |
| Gemini 3 Flash Preview | 71.0 |
| GPT-5.5 | 70.5 |
| Gemini 3 Pro Preview | 70.2 |
| Claude Fable 5 | 67.8 |
| Muse Spark 1.1 | 66.5 |
| Kimi K3 | 66.1 |
| GPT-5.4 | 64.8 |
| GPT-5.6 Terra | 63.6 |
| Grok 4.5 | 63.6 |
| GPT-5.6 Luna | 62.4 |
| Gemini 3.1 Flash-Lite Preview | 61.7 |
| Kimi K2.6 | 61.3 |
| Gemini 2.5 Pro | 60.8 |
| GPT-5.2 | 60.7 |
| o3 | 60.5 |
| GPT-5.1 | 59.8 |
| Opus 4.8 | 59.5 |
| Grok 4.20 | 59.1 |
| GPT-5 | 58.8 |
| Opus 4.7 | 58.1 |
| GPT-5.4 Mini | 58.0 |
| Grok 4.3 | 57.3 |
| Sonnet 4.6 | 56.6 |
| GPT-5 Mini | 56.5 |
| Opus 4.6 | 54.8 |
| Opus 4.5 | 54.0 |
| Gemini 2.5 Flash | 53.7 |
| O1 | 53.3 |
| Gemini 2.5 Flash-Lite Preview 06-17 | 51.0 |
| Sonnet 4.5 | 50.3 |
| Grok 4 | 50.1 |
| O4 Mini | 47.5 |
| GPT-4o (2024-11-20) | 47.0 |
| Grok 4.1 Fast | 46.3 |
| GPT-5.4 Nano | 45.5 |
| Haiku 4.5 | 44.6 |
| Grok 4 Fast | 42.9 |