Atlas

Benchmarks

← All benchmarks

SnorkelUnderwrite 2.0 pass@5

Professional Work

Published pass@5 on the 200-task SnorkelUnderwrite 2.0 release; a correlated diagnostic of the pass@1 leaderboard.

Top models (higher is better)

ModelScore
Grok 4.751.6
GLM-5.351.3
Kimi K350.8
Claude Opus 5.539.4
Claude Fable 5.138.4
Gemini 3.8 Flash35.0
GPT-6 Astra35.0
Claude Opus 534.0
Muse Spark 1.332.7
Grok 4.631.3
Loading Atlas data…