Atlas

Benchmarks

← All benchmarks

Deep Research Bench

Search · 2025-05-06

Deep Research Bench (DRB) evaluates web-research agents in a reproducible RetroSearch environment backed by a frozen web corpus. The live leaderboard macro-averages model scores across eight task categories and currently covers 169 distinct research instances; higher scores are better.

Top models (higher is better)

ModelScore
Opus 4.60.6
Sonnet 4.60.5
Opus 4.50.5
GPT-5.50.5
Opus 4.80.5
Gemini 3 Flash Preview0.5
GPT-50.5
Opus 4.10.5
Gemini 3.1 Pro Preview0.5
Sonnet 4.50.5
Grok 40.5
Opus 40.5
Sonnet 40.5
Gemini 3 Pro Preview0.5
Haiku 4.50.5
o30.5
GPT-5.10.4
Gemini 2.5 Pro0.4
GPT-5.20.4
Gemini 3.1 Flash-Lite Preview0.4
GPT-5.4 Mini0.4
GPT-5.40.4
Loading Atlas data…