Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Net Improvement

Agents · 2026-06-04

Net-improvement score for Agent Arena, summarizing the model’s effect on session outcomes relative to a baseline. Higher net improvement indicates better aggregate agentic value in live arena sessions.

Top models (higher is better)

ModelScore
Claude Fable 512.6
Claude Opus 511.9
GPT-5.6 Sol10.0
Kimi K39.9
Opus 4.89.4
Sonnet 58.6
GPT-5.58.5
Opus 4.78.2
GLM-5.27.1
Opus 4.66.5
Grok 4.55.5
GPT-5.45.1
GPT-5.6 Terra3.5
GPT-5.6 Luna3.5
Sonnet 4.63.2
Muse Spark 1.10.7
GLM-5.10.4
Kimi K2.7 Code0.4
Gemini 3.1 Pro Preview-0.5
Qwen3.7-Max-0.5
DeepSeek-V4-Pro-0.8
Hy3-1.0
Gemini 3.5 Flash-1.0
Kimi K2.6-1.1
Gemini 3.6 Flash-1.6
Qwen3.7-Plus-1.7
MiMo-V2.5-Pro-2.5
MiniMax M3-2.6
DeepSeek-V4-Flash-3.0
Inkling-5.7
Grok Build 0.1-8.0
Grok 4.3-8.0
Gemini 3 Flash Preview-8.8
Gemini 3.5 Flash-Lite-10.2
MiniMax M2.7-11.6
Nemotron 3 Ultra 550B A55B-13.1
Gemma 4 31B IT-16.1
Loading Atlas data…