Atlas

Benchmarks

← All benchmarks

Arena Text Overall — 25% Factuality

Chat & Writing · 2026-07-15

Arena's Text rating with the site's default 25% factuality adjustment applied to the overall raw leaderboard without style control. It is kept separate because factuality weighting changes both ratings and ranks.

Top models (higher is better)

ModelScore
Claude Opus 51493
Opus 4.61493
Claude Fable 51487
GPT-5.41485
GPT-5.51485
Gemini 3 Pro Preview1481
Qwen3.7 Max Preview1480
Gemini 3.5 Flash1477
Opus 4.71476
Gemini 3.6 Flash1473
Opus 4.81472
Kimi K31472
GPT-5.6 Sol1471
Gemini 3.1 Pro Preview1471
Gemini 3 Flash Preview1467
Grok 4.51466
Muse Spark1466
Muse Spark 1.11466
GPT-5.6 Terra1466
MiMo-V2.5-Pro1463
Gemini 2.5 Pro1462
Sonnet 4.61460
GLM-5.11460
GLM-5.21459
GPT-5.11458
Opus 4.51458
Kimi K2.61455
Qwen3.7-Plus1455
DeepSeek-V4-Pro1454
ERNIE 5.11454
GPT-5.6 Luna1454
Sonnet 51454
GLM-51451
Inkling1451
GPT-5.4 Mini1449
Gemma 4 31B1449
Hy31449
Sonnet 4.51448
GLM 4.61448
DeepSeek-V3.2-Exp1447
Loading Atlas data…