Atlas

Benchmarks

← All benchmarks

CorpFin v2

Professional Work · 2025-01-27

Private corporate-finance benchmark evaluating long-context understanding of credit agreements and related finance documents.

Top models (higher is better)

ModelScore
Claude Opus 573.2
Claude Fable 571.8
Kimi K371.6
Muse Spark 1.171.3
Inkling-Small69.6
Inkling68.6
Grok 4.368.5
GPT-5.568.4
Kimi K2.568.3
MiniMax M368.1
Qwen3 Max Thinking (2026-01-23)68.0
Grok 4.567.4
Opus 4.667.0
Sonnet 567.0
Grok 4 Fast66.9
Kimi K2.666.7
Opus 4.866.7
Qwen3.6-Max-Preview66.5
Gemini 3 Flash Preview66.4
GLM-5.266.1
Opus 4.766.1
Grok 466.0
Grok 4.1 Fast66.0
GPT-5.265.9
Nemotron 3 Ultra 550B A55B65.5
Sonnet 4.665.3
GPT-5.6 Terra65.3
Qwen3.5 Plus (2026-02-15)65.3
GPT-5.465.3
Muse Spark65.1
Opus 4.565.1
Gemini 3.5 Flash64.7
Gemini 3.1 Pro Preview64.5
GLM-5.164.5
GPT-5.6 Sol64.4
GPT-5.6 Luna64.2
GPT-5.163.8
Qwen3.7-Max63.7
Gemini 3 Pro Preview63.7
Grok 4.2063.7
Loading Atlas data…