Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - Adjustments

Professional Work · 2026-05-19

The Adjustments split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash54.9
Claude Opus 554.6
Gemini 3.6 Flash53.6
GPT-5.6 Luna52.0
Kimi K351.5
Claude Fable 551.1
GPT-5.6 Terra50.4
Muse Spark 1.149.7
GPT-5.6 Sol49.2
Sonnet 4.648.9
Sonnet 548.7
Opus 4.848.4
GLM-5.246.3
GPT-5.545.7
Opus 4.745.4
GPT-5.4 Mini45.4
GLM-5.143.3
MiniMax M342.3
Gemini 3.5 Flash-Lite41.7
DeepSeek-V4-Pro41.6
Qwen3.7-Max41.2
Grok 4.538.6
Gemini 3.1 Pro Preview38.4
Kimi K2.637.9
Inkling37.8
Gemini 3 Flash Preview35.9
Qwen3.6 Plus (2026-04-02)35.7
Qwen3.7-Plus35.5
Nemotron 3 Ultra 550B A55B34.4
MiMo-V2.5-Pro34.4
GPT-5.4 Nano33.0
Grok 4.331.9
MiMo-V2.531.7
Gemini 3.1 Flash-Lite Preview31.0
Haiku 4.530.5
Mistral Medium 3.527.3
MiniMax M2.721.0
Grok 4.2017.4
Laguna M.115.8
Laguna XS.29.6
Loading Atlas data…