Atlas

Benchmarks

← All benchmarks

Arena Text — Longer Query (No Style Control)

Chat & Writing

Raw Arena rating for longer Text Arena queries without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Opus 4.61520
Claude Opus 51516
Claude Fable 51512
Opus 4.71505
Kimi K31492
Qwen3.7 Max Preview1488
Opus 4.81486
GPT-5.51482
Gemini 3.5 Flash1482
Gemini 3.1 Pro Preview1482
Sonnet 4.61480
MiMo-V2.5-Pro1480
Opus 4.51479
Sonnet 4.51476
GPT-5.41474
Gemini 3.6 Flash1474
Gemini 3 Pro Preview1473
GPT-5.6 Sol1472
GLM-5.11470
GLM-5.21468
Grok 4.51467
Kimi K2.61466
Sonnet 51463
ERNIE 5.11462
Muse Spark 1.11461
Qwen3.7-Plus1460
DeepSeek-V4-Pro1459
MiMo-V2-Pro1456
GPT-5.6 Terra1454
Gemini 3 Flash Preview1452
Gemini 2.5 Pro1449
Muse Spark1449
GLM-51447
MiniMax M31447
Hy31447
GPT-5.11446
MiMo-V2.51445
Opus 4.11445
Kimi K2.51445
Qwen3.5 397B A17B1443
Loading Atlas data…