Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - Market Analysis

Professional Work · 2026-05-19

The Market Analysis split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 574.2
Gemini 3.5 Flash74.0
Gemini 3.6 Flash69.8
Claude Fable 568.9
Muse Spark 1.167.2
Opus 4.867.2
Kimi K366.6
GPT-5.6 Luna64.9
GPT-5.6 Sol64.2
Sonnet 564.1
Opus 4.762.7
GLM-5.261.5
GPT-5.560.3
GPT-5.6 Terra60.1
Qwen3.7-Max59.5
MiniMax M359.0
Gemini 3 Flash Preview59.0
Sonnet 4.658.5
Grok 4.557.8
Gemini 3.5 Flash-Lite57.0
GPT-5.4 Mini56.9
Inkling56.6
Kimi K2.653.1
Gemini 3.1 Pro Preview52.8
GLM-5.151.9
DeepSeek-V4-Pro50.8
Grok 4.350.2
MiMo-V2.5-Pro49.0
MiMo-V2.548.6
Qwen3.7-Plus48.5
Qwen3.6 Plus (2026-04-02)47.3
GPT-5.4 Nano46.5
Nemotron 3 Ultra 550B A55B41.3
Haiku 4.540.7
Mistral Medium 3.537.0
Laguna M.135.6
Gemini 3.1 Flash-Lite Preview34.2
MiniMax M2.733.4
Grok 4.2033.3
Laguna XS.220.4
Loading Atlas data…