Atlas

Benchmarks

← All benchmarks

ZeroBench (Subquestions, pass@1)

Multimodal · 2025-02-13

This ZeroBench split evaluates multimodal visual reasoning on the benchmark's component subquestions. Scores report pass@1 accuracy in percentage points.

Top models (higher is better)

ModelScore
Seed1.5-VL30.8
O4 Mini29.1
GPT-5 Mini27.8
GPT-4.527.0
GPT-526.2
Gemini 2.5 Pro Experimental 03-2526.0
o325.5
Claude 3.5 Sonnet (Oct 2024)25.5
Opus 4.125.3
Opus 425.1
Sonnet 424.6
Gemini 2.5 Flash Preview 04-1724.5
Llama 4 Maverick Instruct23.7
Gemini 2.0 Flash23.2
O1 Pro22.4
GPT-5 Nano21.6
Grok 421.6
Gemini 1.5 Pro20.9
Claude 3.5 Sonnet (June 2024)20.7
GPT-4.120.7
Gemini 2.0 Flash Thinking Experimental 01-2120.5
QVQ 72B Preview20.5
O120.2
GPT-4o19.6
Claude 3.7 Sonnet19.0
Pixtral Large18.7
Gemini 1.5 Flash17.9
GPT-4o Mini16.6
Llama 4 Scout Instruct16.3
Claude 3 Sonnet16.1
Opus 315.1
NVLM-D-72B14.9
Llama 3.2 90B Vision Instruct13.3
Qwen2 VL 72B Instruct13.0
Gemini 1.0 Pro Vision12.4
Claude 3 Haiku12.3
Sonnet 4.59.5
Loading Atlas data…