Atlas

Benchmarks

← All benchmarks

CorpFin v2 - Exact Pages

Professional Work · 2025-01-27

The Exact Pages split of CorpFin v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Kimi K369.3
Inkling68.9
Claude Opus 568.6
Inkling-Small68.6
Gemini 3 Flash Preview68.1
GPT-5.268.1
Grok 4 Fast67.2
Grok 3 Mini67.0
Claude Fable 566.9
Grok 4.366.8
Muse Spark 1.166.4
Grok 4.566.3
Kimi K2.566.2
Grok 466.0
GPT-5.565.6
Grok 4.1 Fast65.5
Opus 4.664.9
MiniMax M364.9
Qwen3 Max Thinking (2026-01-23)64.9
Kimi K2.664.8
Muse Spark64.8
Opus 4.764.3
Opus 4.864.3
GLM-4.564.3
Nemotron 3 Ultra 550B A55B64.3
GPT-5.464.1
O4 Mini64.0
Sonnet 563.9
GLM-5.263.6
GPT-5.6 Luna63.5
o363.5
Opus 4.563.4
Qwen3.6-Max-Preview63.3
Sonnet 4.663.2
GPT-5.6 Terra63.2
GPT-5.163.1
Grok 4.2063.1
Gemini 2.5 Pro62.9
Gemini 3.5 Flash62.8
GPT-4.162.8
Loading Atlas data…