Atlas

Benchmarks

← All benchmarks

Arena Document (Style Controlled)

Professional Work

Style-controlled Document Arena rating for models analyzing document and long-content inputs. Higher ratings indicate stronger preference in blind pairwise user votes after adjusting for response style.

Top models (higher is better)

ModelScore
Claude Fable 51507
Opus 4.71497
Opus 4.61495
Claude Opus 51493
Opus 4.81487
Muse Spark 1.11483
GPT-5.6 Terra1482
GPT-5.6 Sol1481
Sonnet 51479
GPT-5.51478
Sonnet 4.61478
GPT-5.41469
GPT-5.6 Luna1467
Muse Spark1466
Opus 4.51464
Gemini 3.5 Flash1462
Grok 4.51462
Gemini 3.1 Pro Preview1460
Gemini 3 Pro Preview1451
Kimi K2.61450
Qwen3.7-Plus1449
Sonnet 4.51446
Gemma 4 31B1445
Gemini 3 Flash Preview1441
Kimi K2.51435
MiniMax M31434
Gemini 2.5 Pro1430
GPT-5.21426
Haiku 4.51422
GPT-5.11412
GLM 5V Turbo1402
Loading Atlas data…