Atlas

Benchmarks

← All benchmarks

CorpFin v2 - Shared Max Context

Professional Work · 2025-01-27

The Shared Max Context split of CorpFin v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 574.9
Muse Spark 1.173.1
Kimi K372.6
Claude Fable 571.6
Grok 4 Fast71.1
Muse Spark70.5
Kimi K2.570.2
Grok 4.370.0
Inkling-Small69.8
MiniMax M369.7
GPT-5.569.6
Grok 469.3
Inkling69.2
Opus 4.669.0
Qwen3 Max Thinking (2026-01-23)68.5
Grok 4.568.4
Kimi K2.668.2
Sonnet 567.9
Qwen3.6-Max-Preview67.9
Qwen3.5 Plus (2026-02-15)67.8
Gemini 3 Flash Preview67.7
Grok 4.1 Fast67.6
GLM-567.0
GPT-5.466.8
Sonnet 4.666.7
GPT-5.6 Sol66.4
GPT-5.6 Terra66.4
GLM-5.266.3
Opus 4.566.2
Opus 4.766.1
Opus 4.866.0
Grok 4.2065.9
Gemini 3.1 Pro Preview65.7
GPT-5.265.7
GPT-4.165.5
Qwen3.7-Max65.4
GLM-5.165.3
GPT-5.165.0
GPT-5.6 Luna65.0
Nemotron 3 Ultra 550B A55B64.9
Loading Atlas data…