Atlas

Benchmarks

← All benchmarks

Arena Text — Hard Prompts (No Style Control)

Chat & Writing

Raw Arena rating for hard Text Arena prompts without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Opus 4.61527
Claude Opus 51526
Claude Fable 51513
Opus 4.71504
GPT-5.51488
Muse Spark 1.11486
GPT-5.41486
Gemini 3.6 Flash1486
Gemini 3.5 Flash1486
MiMo-V2.5-Pro1485
Kimi K31484
Gemini 3.1 Pro Preview1484
Sonnet 4.61484
Qwen3.7 Max Preview1482
Gemini 3 Pro Preview1482
Opus 4.81482
ERNIE 5.11480
GPT-5.6 Sol1476
Opus 4.51475
GLM-5.11475
Muse Spark1474
GLM-5.21471
Kimi K2.61469
GPT-5.6 Terra1469
Grok 4.51467
Qwen3.7-Plus1465
Gemini 3 Flash Preview1465
Sonnet 51464
DeepSeek-V4-Pro1462
Sonnet 4.51462
MiMo-V2-Pro1458
Gemini 2.5 Pro1455
GPT-5.11454
Kimi K2.51454
GLM-51452
GPT-5.6 Luna1451
Inkling1451
MiMo-V2.51450
MiniMax M31450
Qwen3 Max Preview1449
Loading Atlas data…