Atlas

Benchmarks

← All benchmarks

Arena Text — Hard Prompts English (No Style Control)

Chat & Writing

Raw Arena rating for hard English Text Arena prompts without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Opus 4.61532
Claude Opus 51524
Claude Fable 51511
Opus 4.71504
MiMo-V2.5-Pro1497
Sonnet 4.61494
Gemini 3.6 Flash1488
Kimi K31488
Muse Spark 1.11484
GLM-5.11484
ERNIE 5.11484
GPT-5.51482
Opus 4.81482
Gemini 3.1 Pro Preview1481
Opus 4.51481
GPT-5.41480
Gemini 3.5 Flash1479
Gemini 3 Pro Preview1478
Muse Spark1476
Qwen3.7 Max Preview1474
GPT-5.6 Sol1474
MiMo-V2-Pro1473
Sonnet 4.51471
GLM-5.21470
Kimi K2.61469
Sonnet 51466
Grok 4.51465
Qwen3.7-Plus1465
DeepSeek-V4-Pro1464
MiMo-V2.51461
MiniMax M31461
GPT-5.6 Luna1460
GLM-51459
Kimi K2.51459
GPT-5.6 Terra1458
Gemini 3 Flash Preview1458
GPT-5.11458
GLM 5V Turbo1456
Qwen3.6 Plus (2026-04-02)1455
Gemma 4 31B1454
Loading Atlas data…