Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - General Qualitative Analysis

Professional Work · 2026-05-19

The General Qualitative Analysis split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 575.4
Sonnet 4.671.6
Grok 4.571.1
Claude Fable 570.3
GLM-5.268.7
GPT-5.6 Luna66.6
Opus 4.866.4
Muse Spark 1.166.4
Kimi K365.6
GPT-5.565.6
Opus 4.765.4
GPT-5.6 Sol64.9
Sonnet 564.7
GLM-5.163.7
Qwen3.7-Max63.5
Inkling62.9
MiniMax M361.7
GPT-5.6 Terra61.6
Gemini 3.6 Flash60.5
DeepSeek-V4-Pro60.3
Nemotron 3 Ultra 550B A55B58.5
Kimi K2.657.3
Gemini 3.5 Flash56.8
Grok 4.353.2
Qwen3.6 Plus (2026-04-02)51.9
Gemini 3.5 Flash-Lite51.1
MiMo-V2.5-Pro50.8
MiMo-V2.548.0
Mistral Medium 3.547.9
GPT-5.4 Mini46.4
GPT-5.4 Nano46.3
Qwen3.7-Plus46.0
Grok 4.2045.9
Gemini 3.1 Pro Preview45.2
Haiku 4.545.1
Gemini 3 Flash Preview44.6
MiniMax M2.742.4
Laguna M.136.5
Gemini 3.1 Flash-Lite Preview36.2
Laguna XS.228.9
Loading Atlas data…