Atlas

Benchmarks

← All benchmarks

Arena Text — Multi-turn (No Style Control)

Chat & Writing

Raw Arena rating for multi-turn Text Arena conversations without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Opus 4.61512
Opus 4.71505
Claude Fable 51503
Claude Opus 51496
Muse Spark 1.11490
Gemini 3.5 Flash1490
Kimi K31487
Gemini 3 Pro Preview1483
Gemini 3.1 Pro Preview1483
GPT-5.41483
Opus 4.81482
Qwen3.7 Max Preview1482
Gemini 3.6 Flash1478
GPT-5.51478
Muse Spark1477
GLM-5.11476
Gemini 3 Flash Preview1472
ERNIE 5.11472
MiMo-V2.5-Pro1472
DeepSeek-V4-Pro1467
GLM-5.21465
Sonnet 4.51465
Qwen3.7-Plus1465
Opus 4.51465
Sonnet 4.61462
GPT-5.6 Sol1460
MiMo-V2-Pro1459
Grok 4.51457
GPT-5.6 Terra1457
GLM-51456
Kimi K2.61453
Gemini 2.5 Pro1452
Gemma 4 31B1451
Sonnet 51450
Hy31450
DeepSeek-V4-Flash1449
Qwen3 Max Preview1449
GPT-5.11448
GLM-4.71448
Qwen3.5 397B A17B1445
Loading Atlas data…