Atlas

Benchmarks

← All benchmarks

DiligenceBench

Professional Work · 2026-07-17

DiligenceBench evaluates end-to-end research agents on 150 open-ended equity-research tasks covering 143 US public companies across ten sectors. Agents must locate filings, extract disclosures, calculate from evidence, and deliver analyst judgments; GPT-5.5 grades 5,428 task-specific weighted criteria spanning factual accuracy, analytical reasoning, and risk awareness.

Top models (higher is better)

ModelScore
Muse Spark 1.157.4
GLM-5.251.0
Sonnet 4.651.0
GPT-5.6 Sol50.0
GPT-5.6 Terra49.1
GLM-5.148.1
GPT-5.6 Luna48.1
MiniMax M347.7
GPT-5.547.5
Opus 4.847.1
Kimi K2.643.5
Gemini 3.5 Flash41.3
Haiku 4.537.6
GPT-5.4 Mini33.8
Inkling32.8
Gemini 3.1 Pro Preview30.1
Loading Atlas data…