Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - Precedents

Professional Work · 2026-05-19

The Precedents split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash36.4
Muse Spark 1.133.8
Gemini 3.6 Flash30.8
GPT-5.6 Luna29.1
Sonnet 528.8
Claude Fable 528.1
GPT-5.6 Sol26.2
GPT-5.6 Terra26.1
Gemini 3.5 Flash-Lite26.0
Claude Opus 525.9
Opus 4.825.6
Inkling24.8
MiniMax M323.2
Kimi K323.1
GPT-5.4 Mini22.1
GPT-5.521.9
Opus 4.721.5
GPT-5.4 Nano20.8
Gemini 3.1 Pro Preview20.8
MiMo-V2.5-Pro20.6
Qwen3.7-Max20.0
Kimi K2.619.5
GLM-5.219.4
Grok 4.519.4
Sonnet 4.618.9
Gemini 3 Flash Preview18.1
Qwen3.7-Plus18.1
GLM-5.117.8
MiMo-V2.517.2
Qwen3.6 Plus (2026-04-02)17.1
DeepSeek-V4-Pro15.6
Grok 4.2015.5
Grok 4.315.3
Mistral Medium 3.512.9
Nemotron 3 Ultra 550B A55B12.8
MiniMax M2.711.9
Gemini 3.1 Flash-Lite Preview11.8
Laguna M.111.1
Haiku 4.511.0
Laguna XS.25.8
Loading Atlas data…