Atlas

Benchmarks

← All benchmarks

SnorkelFinance 2.0

Professional Work

Pass@1 on 200 operational investment-banking and private-equity tasks, covering evidence, analytical correctness, compliance-aware tools and required environment state changes. This workflow release is distinct from the original financial QA dataset. Native effort and agent scaffold are not disclosed.

Top models (higher is better)

ModelScore
Grok 4.625.1
GLM-5.321.2
Grok 4.720.2
Claude Fable 5.119.6
Claude Opus 5.518.6
Kimi K317.3
Claude Opus 516.5
GPT-6 Astra11.6
Muse Spark 1.310.0
Gemini 3.8 Flash5.4
Loading Atlas data…