Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - Earnings Analysis

Professional Work · 2026-05-19

The Earnings Analysis split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash79.0
Claude Fable 577.3
Muse Spark 1.176.2
Gemini 3.6 Flash75.3
GPT-5.6 Luna74.9
GPT-5.6 Sol74.4
Claude Opus 573.8
GPT-5.6 Terra73.7
GPT-5.573.2
Kimi K373.1
Sonnet 572.6
Opus 4.872.1
Opus 4.771.6
Grok 4.570.8
GLM-5.266.6
MiniMax M366.2
GPT-5.4 Mini65.3
Sonnet 4.665.1
Gemini 3.1 Pro Preview64.7
Gemini 3.5 Flash-Lite64.4
Kimi K2.663.8
Gemini 3 Flash Preview62.1
Inkling60.4
Qwen3.7-Max60.2
DeepSeek-V4-Pro59.8
GLM-5.157.0
MiMo-V2.5-Pro54.6
Qwen3.6 Plus (2026-04-02)52.4
Qwen3.7-Plus50.3
Grok 4.347.7
GPT-5.4 Nano45.6
MiMo-V2.545.0
Mistral Medium 3.542.1
Nemotron 3 Ultra 550B A55B40.6
Grok 4.2034.4
MiniMax M2.731.8
Gemini 3.1 Flash-Lite Preview31.3
Haiku 4.526.7
Laguna M.125.9
Laguna XS.215.3
Loading Atlas data…