Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - General Quantitative Analysis

Professional Work · 2026-05-19

The General Quantitative Analysis split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.6 Flash81.8
Claude Fable 580.8
Claude Opus 578.5
Gemini 3.5 Flash77.6
Muse Spark 1.176.8
GPT-5.6 Sol75.6
GPT-5.6 Luna75.2
Kimi K374.4
Sonnet 574.3
GPT-5.573.7
Sonnet 4.672.0
GPT-5.6 Terra71.9
Opus 4.871.6
Opus 4.770.1
Qwen3.7-Max67.1
Gemini 3.1 Pro Preview67.0
MiniMax M366.5
Gemini 3.5 Flash-Lite66.1
DeepSeek-V4-Pro65.8
GLM-5.265.5
Kimi K2.665.1
Gemini 3 Flash Preview64.5
Inkling64.2
GPT-5.4 Mini64.0
Grok 4.563.6
GLM-5.161.9
MiMo-V2.5-Pro61.0
GPT-5.4 Nano58.3
Qwen3.6 Plus (2026-04-02)58.2
Nemotron 3 Ultra 550B A55B55.8
MiMo-V2.555.7
Qwen3.7-Plus52.2
Grok 4.351.8
Gemini 3.1 Flash-Lite Preview49.9
Haiku 4.546.0
Mistral Medium 3.544.8
MiniMax M2.743.0
Laguna M.139.3
Grok 4.2037.2
Laguna XS.222.7
Loading Atlas data…