Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Net Improvement (Steering Burden)

Agents

Agent Arena net-improvement aggregate using the five September 30 signals: confirmed success, praise versus complaint, steering_burden, bash recovery and tool hallucination. The steering_burden source signal replaces steerability; preserved separately from the earlier aggregate because the source key and observation population changed.

Top models (higher is better)

ModelScore
Claude Fable 5.114.6
GPT-6 Astra12.2
GPT-6 Sol10.6
Claude Opus 58.8
Claude Fable 58.4
Gemini 4 Argon7.9
GPT-5.6 Sol7.1
Opus 4.86.9
Sonnet 54.8
Hy4 Preview4.2
Muse Spark 1.34.2
GPT-5.54.1
DeepSeek V4.1 Flash4.0
Kimi K34.0
Grok 4.73.6
GLM-5.23.6
Gemini 3.8 Flash3.0
Qwen3.8-Max2.8
GLM-5.32.6
DeepSeek V4 Pro 08131.3
Grok 4.61.2
Grok 4.51.1
GPT-5.40.9
GPT-5.6 Terra0.8
GLM-5.3 Flash-0.3
Qwen3.8-Flash-Next-0.8
GPT-5.6 Luna-1.1
Qwen3.8 27B-1.6
Gemini 3.7 Flash-1.6
Muse Spark 1.2-3.0
Muse Spark 1.1-4.6
Qwen3.7-Max-5.2
Hy3-5.7
MiniMax M3-6.7
MiMo-V2.5-Pro-7.2
Qwen3.7-Plus-7.3
Gemini 3.1 Pro Preview-7.3
Gemini 3.6 Flash-7.7
Inkling-Small-9.8
Inkling-10.9
Loading Atlas data…