Atlas

Benchmarks

← All benchmarks

ZeroBench Main Questions pass^5

Multimodal · 2025-02-13

ZeroBench pass^5 is the main-question consistency metric on ZeroBench, a visual reasoning benchmark for large multimodal models. It is computed from five samples and reported alongside pass@5 on the official leaderboard.

Top models (higher is better)

ModelScore
GPT-5.510.0
Claude Fable 58.0
GPT-5.48.0
Gemini 3.1 Pro Preview7.0
GPT-5.26.0
Gemini 3.5 Flash5.0
GPT-5.4 Mini5.0
Gemini 3 Pro Preview5.0
Opus 4.84.0
Opus 4.74.0
GPT-5 Mini3.0
Sonnet 4.62.0
Opus 4.62.0
Gemini 3 Flash Preview2.0
Gemini 3.1 Flash-Lite Preview1.0
Opus 4.51.0
Opus 4.11.0
Opus 41.0
Sonnet 41.0
Llama 4 Scout Instruct1.0
Gemini 2.5 Pro Experimental 03-251.0
Gemini 2.5 Flash Preview 04-171.0
GPT-5.10.0
Sonnet 4.50.0
GPT-50.0
GPT-5 Nano0.0
Grok 40.0
o30.0
O4 Mini0.0
Llama 4 Maverick Instruct0.0
GPT-4.10.0
GPT-4.50.0
Claude 3.7 Sonnet0.0
O1 Pro0.0
O10.0
Gemini 2.0 Flash Thinking Experimental 01-210.0
QVQ 72B Preview0.0
GPT-4o0.0
GPT-4o Mini0.0
Gemini 2.0 Flash0.0
Loading Atlas data…