Atlas

Benchmarks

← All benchmarks

Deep Research Bench — Validate Claim

Search · 2025-05-06

The DRB Validate Claim category asks an agent to estimate the probability that an online claim is true using evidence from the frozen web corpus.

Top models (higher is better)

ModelScore
Sonnet 4.60.8
Opus 4.60.8
GPT-50.8
Opus 4.50.8
GPT-5.50.8
Opus 4.80.8
o30.7
GPT-5.4 Mini0.7
GPT-5.10.7
Opus 4.10.7
Sonnet 40.7
Sonnet 4.50.7
Gemini 3.1 Pro Preview0.7
Gemini 3 Pro Preview0.7
Grok 40.7
GPT-5.20.6
GPT-5.40.6
Gemini 2.5 Pro0.6
Haiku 4.50.6
Gemini 3 Flash Preview0.6
Opus 40.6
Gemini 3.1 Flash-Lite Preview0.6
Loading Atlas data…