ZeroBench (Main questions, pass@5)
Multimodal · 2025-02-13
This row reports pass@5 on ZeroBench's 100 main visual-reasoning questions: the percentage answered correctly at least once across five sampled attempts.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 23.0 |
| GPT-5.4 | 23.0 |
| Kimi K3 | 23.0 |
| GPT-5.5 | 22.0 |
| Gemini 3.5 Flash | 19.0 |
| Gemini 3.1 Pro Preview | 19.0 |
| Gemini 3 Pro Preview | 19.0 |
| Opus 4.8 | 17.0 |
| GPT-5.2 | 17.0 |
| GPT-5.6 Sol | 17.0 |
| Opus 4.7 | 14.0 |
| Gemini 3 Flash Preview | 13.0 |
| Sonnet 4.6 | 11.0 |
| Opus 4.6 | 11.0 |
| GPT-5.4 Mini | 10.0 |
| Opus 4.5 | 10.0 |
| O4 Mini | 10.0 |
| GPT-5 Mini | 9.0 |
| Opus 4.1 | 8.0 |
| GPT-5 | 7.0 |
| GPT-4.5 | 7.0 |
| Sonnet 4 | 6.0 |
| o3 | 6.0 |
| GPT-5.1 | 5.0 |
| Opus 4 | 5.0 |
| Gemini 2.5 Pro Experimental 03-25 | 5.0 |
| Gemini 2.0 Flash Thinking Experimental 01-21 | 5.0 |
| Gemini 3.1 Flash-Lite Preview | 4.0 |
| Grok 4 | 4.0 |
| QVQ 72B Preview | 4.0 |
| Sonnet 4.5 | 3.0 |
| GPT-5 Nano | 3.0 |
| GPT-4.1 | 3.0 |
| Gemini 2.5 Flash Preview 04-17 | 3.0 |
| Gemini 2.0 Flash | 3.0 |
| Pixtral Large | 3.0 |
| Llama 4 Maverick Instruct | 2.0 |
| Llama 4 Scout Instruct | 2.0 |
| Claude 3.7 Sonnet | 2.0 |
| GPT-4o Mini | 2.0 |