Atlas

Benchmarks

← All benchmarks

Arena Text — Non-English (No Style Control)

Chat & Writing

Raw Arena rating for the non-English Text Arena aggregate without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Claude Opus 51512
Opus 4.61489
Claude Fable 51488
Opus 4.71482
Gemini 3.1 Pro Preview1477
Gemini 3.5 Flash1477
Gemini 3 Pro Preview1475
Qwen3.7 Max Preview1473
Muse Spark 1.11471
Gemini 3.6 Flash1468
GPT-5.51468
GPT-5.41465
Muse Spark1463
Gemini 3 Flash Preview1463
Kimi K31463
ERNIE 5.11454
Gemini 2.5 Pro1454
Opus 4.81453
GLM-5.21451
Qwen3.7-Plus1451
GLM-5.11450
GPT-5.6 Sol1447
Kimi K2.61447
GPT-5.6 Terra1446
Grok 4.51445
MiMo-V2.5-Pro1444
DeepSeek-V4-Pro1441
Sonnet 4.61438
Opus 4.51435
Inkling1434
Qwen3 Max Preview1433
Kimi K2.51433
GPT-5.11431
Gemma 4 31B1431
Gemini 3.5 Flash-Lite1431
Sonnet 51431
Qwen3.5 397B A17B1431
GLM-51430
Hy31429
Grok 4.11428
Loading Atlas data…