Atlas

Benchmarks

← All benchmarks

Document Arena

Professional Work · 2026-06-10

Arena-style leaderboard for document analysis and long-content reasoning tasks, reported as arena/Elo-style model scores.

Top models (higher is better)

ModelScore
Claude Opus 51520
Opus 4.61510
Claude Fable 51504
Opus 4.71498
GPT-5.51485
Sonnet 4.61483
GPT-5.6 Terra1479
GPT-5.6 Sol1479
Opus 4.81475
Muse Spark 1.11472
Sonnet 51470
GPT-5.41470
Gemini 3.5 Flash1465
GPT-5.6 Luna1462
Opus 4.51462
Grok 4.51454
Kimi K2.61451
Sonnet 4.51446
Gemini 3.1 Pro Preview1445
Muse Spark1443
Qwen3.7-Plus1440
MiniMax M31435
Gemini 3 Pro Preview1433
Kimi K2.51429
Gemma 4 31B1424
Haiku 4.51423
Gemini 2.5 Pro1421
GLM 5V Turbo1417
Gemini 3 Flash Preview1413
GPT-5.21405
GPT-5.11401
Loading Atlas data…