Atlas

Benchmarks

← All benchmarks

Arena Text — Occupational Mathematical (No Style Control)

Math

Raw Arena rating for mathematical industry prompts without style-control adjustment. Higher ratings indicate stronger preference in blind pairwise user votes.

Top models (higher is better)

ModelScore
Claude Opus 51561
Opus 4.61526
Claude Fable 51512
Gemini 3.5 Flash1512
Opus 4.71505
Gemini 3.6 Flash1504
GPT-5.41495
Opus 4.81493
GPT-5.6 Sol1492
MiMo-V2.5-Pro1492
GPT-5.51490
ERNIE 5.11487
Muse Spark 1.11485
GLM-5.21484
Sonnet 4.61482
Grok 4.51481
Gemini 3.1 Pro Preview1479
Kimi K2.61479
Qwen3.7-Plus1477
Sonnet 51477
GLM-5.11476
Gemini 3 Pro Preview1475
Kimi K2.51474
GPT-5.6 Terra1470
Opus 4.51470
Gemma 4 26B A4B1470
Qwen3.7 Max Preview1470
Gemini 3 Flash Preview1465
Gemma 4 31B1465
MiMo-V2-Pro1463
GPT-5.6 Luna1460
Inkling1458
Qwen3.5 397B A17B1458
Gemini 2.5 Pro1454
DeepSeek-V4-Pro1454
Muse Spark1454
MiniMax M31451
MiMo-V2.51450
Qwen3.6 Plus (2026-04-02)1449
GLM-51449
Loading Atlas data…