Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - All Pass

Professional Work · 2026-05-19

Finance Agent v2 strict All-Pass grading metric over all 450 held-out test questions. Every required answer component must pass; published results are means over three model runs.

Top models (higher is better)

ModelScore
Claude Opus 547.7
Gemini 3.5 Flash45.7
Claude Fable 545.7
Muse Spark 1.144.9
Gemini 3.6 Flash44.6
Opus 4.843.5
GPT-5.6 Luna43.3
Sonnet 542.1
Kimi K341.7
GPT-5.6 Sol41.4
GPT-5.6 Terra40.4
GPT-5.539.6
Sonnet 4.638.8
Opus 4.738.6
GLM-5.238.0
Grok 4.536.7
MiniMax M336.7
Gemini 3.5 Flash-Lite35.3
Qwen3.7-Max34.6
Inkling33.4
GLM-5.132.7
Kimi K2.632.6
GPT-5.4 Mini32.4
DeepSeek-V4-Pro31.4
Gemini 3.1 Pro Preview30.9
Gemini 3 Flash Preview30.2
Qwen3.6 Plus (2026-04-02)29.4
MiMo-V2.5-Pro28.8
Grok 4.326.4
GPT-5.4 Nano26.0
Qwen3.7-Plus25.8
Nemotron 3 Ultra 550B A55B24.8
MiMo-V2.523.8
Mistral Medium 3.521.6
Haiku 4.519.8
Gemini 3.1 Flash-Lite Preview19.3
Grok 4.2017.5
MiniMax M2.717.1
Laguna M.114.4
Laguna XS.26.8
Loading Atlas data…