Atlas

Benchmarks

← All benchmarks

Arena Text — Instruction Following (No Style Control)

Chat & Writing

Raw Arena rating for instruction-following Text Arena prompts without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Opus 4.61522
Claude Opus 51515
Claude Fable 51508
Opus 4.71497
Opus 4.81479
GPT-5.51478
Sonnet 4.61477
MiMo-V2.5-Pro1475
Kimi K31474
GPT-5.6 Sol1472
Opus 4.51472
GPT-5.41471
Gemini 3.6 Flash1470
Gemini 3.1 Pro Preview1466
Gemini 3.5 Flash1465
Muse Spark 1.11461
Qwen3.7 Max Preview1460
Gemini 3 Pro Preview1459
ERNIE 5.11459
Sonnet 4.51459
GLM-5.21455
GLM-5.11454
GPT-5.6 Terra1454
Kimi K2.61449
Sonnet 51448
Grok 4.51447
DeepSeek-V4-Pro1446
Qwen3.7-Plus1444
MiMo-V2-Pro1444
Muse Spark1442
GPT-5.6 Luna1441
GPT-5.11440
Gemini 3 Flash Preview1437
Gemini 2.5 Pro1437
MiniMax M31436
Opus 4.11434
MiMo-V2.51434
Gemma 4 31B1431
Kimi K2.51430
GLM-51428
Loading Atlas data…