Atlas

Benchmarks

← All benchmarks

ZeroBench (Main questions, pass@5)

Multimodal · 2025-02-13

This row reports pass@5 on ZeroBench's 100 main visual-reasoning questions: the percentage answered correctly at least once across five sampled attempts.

Top models (higher is better)

ModelScore
Claude Fable 523.0
GPT-5.423.0
Kimi K323.0
GPT-5.522.0
Gemini 3.5 Flash19.0
Gemini 3.1 Pro Preview19.0
Gemini 3 Pro Preview19.0
Opus 4.817.0
GPT-5.217.0
GPT-5.6 Sol17.0
Opus 4.714.0
Gemini 3 Flash Preview13.0
Sonnet 4.611.0
Opus 4.611.0
GPT-5.4 Mini10.0
Opus 4.510.0
O4 Mini10.0
GPT-5 Mini9.0
Opus 4.18.0
GPT-57.0
GPT-4.57.0
Sonnet 46.0
o36.0
GPT-5.15.0
Opus 45.0
Gemini 2.5 Pro Experimental 03-255.0
Gemini 2.0 Flash Thinking Experimental 01-215.0
Gemini 3.1 Flash-Lite Preview4.0
Grok 44.0
QVQ 72B Preview4.0
Sonnet 4.53.0
GPT-5 Nano3.0
GPT-4.13.0
Gemini 2.5 Flash Preview 04-173.0
Gemini 2.0 Flash3.0
Pixtral Large3.0
Llama 4 Maverick Instruct2.0
Llama 4 Scout Instruct2.0
Claude 3.7 Sonnet2.0
GPT-4o Mini2.0
Loading Atlas data…