Deep Research Bench
Search · 2025-05-06
Deep Research Bench (DRB) evaluates web-research agents in a reproducible RetroSearch environment backed by a frozen web corpus. The live leaderboard macro-averages model scores across eight task categories and currently covers 169 distinct research instances; higher scores are better.
Top models (higher is better)
| Model | Score |
|---|---|
| Opus 4.6 | 0.6 |
| Sonnet 4.6 | 0.5 |
| Opus 4.5 | 0.5 |
| GPT-5.5 | 0.5 |
| Opus 4.8 | 0.5 |
| Gemini 3 Flash Preview | 0.5 |
| GPT-5 | 0.5 |
| Opus 4.1 | 0.5 |
| Gemini 3.1 Pro Preview | 0.5 |
| Sonnet 4.5 | 0.5 |
| Grok 4 | 0.5 |
| Opus 4 | 0.5 |
| Sonnet 4 | 0.5 |
| Gemini 3 Pro Preview | 0.5 |
| Haiku 4.5 | 0.5 |
| o3 | 0.5 |
| GPT-5.1 | 0.4 |
| Gemini 2.5 Pro | 0.4 |
| GPT-5.2 | 0.4 |
| Gemini 3.1 Flash-Lite Preview | 0.4 |
| GPT-5.4 Mini | 0.4 |
| GPT-5.4 | 0.4 |