Atlas

Benchmarks

← All benchmarks

ERQA

Multimodal · 2025-03-25

Embodied reasoning QA benchmark for spatial and action reasoning.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash75.4
Gemini 3.1 Pro Preview74.2
GPT-5.6 Sol71.2
Gemini 3 Flash Preview71.0
GPT-5.570.5
Gemini 3 Pro Preview70.2
Claude Fable 567.8
Muse Spark 1.166.5
Kimi K366.1
GPT-5.464.8
GPT-5.6 Terra63.6
Grok 4.563.6
GPT-5.6 Luna62.4
Gemini 3.1 Flash-Lite Preview61.7
Kimi K2.661.3
Gemini 2.5 Pro60.8
GPT-5.260.7
o360.5
GPT-5.159.8
Opus 4.859.5
Grok 4.2059.1
GPT-558.8
Opus 4.758.1
GPT-5.4 Mini58.0
Grok 4.357.3
Sonnet 4.656.6
GPT-5 Mini56.5
Opus 4.654.8
Opus 4.554.0
Gemini 2.5 Flash53.7
O153.3
Gemini 2.5 Flash-Lite Preview 06-1751.0
Sonnet 4.550.3
Grok 450.1
O4 Mini47.5
GPT-4o (2024-11-20)47.0
Grok 4.1 Fast46.3
GPT-5.4 Nano45.5
Haiku 4.544.6
Grok 4 Fast42.9
Loading Atlas data…