Atlas

Benchmarks

← All benchmarks

Arena Text — Non-English (Style Controlled)

Chat & Writing

Style-controlled Arena rating for the non-English Text Arena aggregate. Higher ratings indicate stronger preference in blind pairwise user votes after adjusting for response style.

Top models (higher is better)

ModelScore
Claude Fable 51500
Opus 4.71492
Claude Opus 51492
Opus 4.61490
Muse Spark 1.11483
Gemini 3.1 Pro Preview1479
Gemini 3 Pro Preview1478
Muse Spark1477
GPT-5.51476
Kimi K31474
GPT-5.6 Sol1473
Opus 4.81473
Gemini 3.5 Flash1472
Gemini 3.6 Flash1471
Qwen3.7 Max Preview1469
GPT-5.41469
Gemini 3 Flash Preview1467
GPT-5.6 Terra1461
Grok 4.51460
Grok 4.11456
Opus 4.51456
Sonnet 4.61455
GLM-5.21454
ERNIE 5.11453
GLM-5.11452
Kimi K2.61449
Qwen3.7-Plus1449
Sonnet 51448
Gemini 3.5 Flash-Lite1448
MiMo-V2.5-Pro1447
DeepSeek-V4-Pro1447
GPT-5.11444
GPT-5.3 Instant1442
Hy31442
Gemini 2.5 Pro1440
GPT-5.4 Mini1439
Sonnet 4.51439
Gemma 4 31B1439
GLM-51439
Kimi K2.51435
Loading Atlas data…