Atlas

Benchmarks

← All benchmarks

Finance Agent v2 - Disclosure Analysis

Professional Work · 2026-05-19

The Disclosure Analysis split of Finance Agent v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 571.3
Claude Fable 568.8
Sonnet 4.665.8
Opus 4.865.7
Kimi K365.3
Gemini 3.5 Flash63.9
Muse Spark 1.163.4
GPT-5.6 Sol63.3
GPT-5.6 Luna62.8
Sonnet 562.1
Gemini 3.6 Flash62.0
GLM-5.261.6
Opus 4.761.3
GPT-5.6 Terra61.3
MiniMax M359.8
Qwen3.7-Max59.2
GPT-5.558.9
Grok 4.556.4
Gemini 3.5 Flash-Lite56.1
Inkling53.2
MiMo-V2.5-Pro53.1
GLM-5.152.7
DeepSeek-V4-Pro52.6
Kimi K2.652.1
Nemotron 3 Ultra 550B A55B51.3
GPT-5.4 Mini48.3
Grok 4.347.7
MiMo-V2.547.3
Gemini 3.1 Pro Preview46.2
Gemini 3 Flash Preview45.8
Qwen3.6 Plus (2026-04-02)44.5
Qwen3.7-Plus44.4
GPT-5.4 Nano42.8
Haiku 4.542.5
Mistral Medium 3.540.2
Grok 4.2040.0
Gemini 3.1 Flash-Lite Preview37.4
MiniMax M2.735.0
Laguna M.130.5
Laguna XS.218.7
Loading Atlas data…