Atlas

Benchmarks

← All benchmarks

Arena Text — Legal & Government (No Style Control)

Professional Work

Raw Arena rating for legal and government industry prompts without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Claude Opus 51544
Kimi K31532
Opus 4.61512
Opus 4.71502
Claude Fable 51495
Gemini 3.6 Flash1494
Gemini 3 Pro Preview1494
GPT-5.51490
Muse Spark1490
Gemini 3.1 Pro Preview1487
GPT-5.41486
Gemini 3.5 Flash1485
Muse Spark 1.11482
GPT-5.6 Terra1479
Gemini 2.5 Pro1478
MiMo-V2.5-Pro1478
Gemini 3 Flash Preview1477
Opus 4.81475
Qwen3.7 Max Preview1473
GLM-5.21472
GLM-5.11471
Sonnet 4.61469
ERNIE 5.11469
GPT-5.6 Sol1467
DeepSeek-V4-Pro1462
Sonnet 51460
Grok 4.51459
Opus 4.51458
Kimi K2.61458
Qwen3.7-Plus1458
Gemma 4 26B A4B1457
DeepSeek-V3.1-Terminus1457
GPT-5.11455
GPT-5.6 Luna1453
GLM-51452
GLM 4.61450
Sonnet 4.51449
MiMo-V2-Pro1447
GLM-4.71445
Grok 4.11444
Loading Atlas data…