Atlas

Benchmarks

← All benchmarks

Arena Text — Life, Physical & Social Science (No Style Control)

Professional Work

Raw Arena rating for life, physical, and social-science industry prompts without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Claude Opus 51525
Kimi K31520
Opus 4.61519
Opus 4.71507
Claude Fable 51507
Gemini 3.5 Flash1498
Gemini 3.1 Pro Preview1496
Gemini 3.6 Flash1494
Muse Spark 1.11489
Gemini 3 Pro Preview1486
ERNIE 5.11484
Qwen3.7 Max Preview1483
GPT-5.51483
GLM-5.21483
MiMo-V2.5-Pro1481
Gemini 2.5 Pro1480
GLM-5.11479
Opus 4.81479
Muse Spark1478
GPT-5.41477
Sonnet 4.61473
Gemini 3 Flash Preview1472
DeepSeek-V4-Pro1470
Grok 4.51468
Kimi K2.61468
Qwen3.7-Plus1467
Hy31467
GLM-51460
Kimi K2.51460
Qwen3.5 397B A17B1459
GLM 4.61458
Qwen3 Max Preview1458
MiMo-V2-Pro1458
Inkling1457
Sonnet 51456
GPT-5.11456
GLM-4.71456
Gemini 3.5 Flash-Lite1455
Gemma 4 31B1455
Opus 4.51452
Loading Atlas data…