Atlas

Benchmarks

← All benchmarks

Finance Agent v2

Professional Work · 2026-05-19

Finance Agent v2 evaluates agents on 927 expert-reviewed financial-analysis questions across public, private-validation, and held-out test splits. Tasks require researching public-company filings and carrying out realistic, multi-step analyst work.

Top models (higher is better)

ModelScore
Claude Opus 558.6
Gemini 3.5 Flash57.9
Muse Spark 1.157.2
Claude Fable 556.3
Gemini 3.6 Flash56.3
GPT-5.6 Luna55.0
Kimi K354.4
Opus 4.853.9
Sonnet 553.9
GPT-5.6 Sol53.8
GPT-5.6 Terra52.4
GPT-5.551.8
Opus 4.751.5
GLM-5.249.7
Grok 4.548.3
MiniMax M348.3
Qwen3.7-Max47.8
Gemini 3.5 Flash-Lite47.4
Inkling46.6
GPT-5.4 Mini45.4
Kimi K2.644.9
GLM-5.144.8
DeepSeek-V4-Pro44.1
Gemini 3.1 Pro Preview43.0
Gemini 3 Flash Preview42.6
MiMo-V2.5-Pro41.5
Qwen3.6 Plus (2026-04-02)40.8
Qwen3.7-Plus38.2
GPT-5.4 Nano38.2
Grok 4.337.7
Nemotron 3 Ultra 550B A55B37.7
MiMo-V2.536.7
Mistral Medium 3.532.1
Haiku 4.531.0
Gemini 3.1 Flash-Lite Preview30.0
Grok 4.2028.5
MiniMax M2.727.9
Laguna M.125.0
Laguna XS.215.6
Loading Atlas data…