Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Confirmed Success

Agents · 2026-06-04

Signed percentage-point Agent Arena diagnostic signal for sessions where the user explicitly confirmed task completion. Values may be negative when a model is below the leaderboard baseline; higher values indicate more reliably successful agent sessions.

Top models (higher is better)

ModelScore
Claude Opus 517.6
Kimi K314.2
Claude Fable 510.3
GLM-5.29.1
Opus 4.88.7
GPT-5.6 Sol8.6
Sonnet 57.9
Opus 4.76.2
GPT-5.55.8
Muse Spark 1.15.6
GPT-5.44.9
Kimi K2.7 Code4.7
Grok 4.54.6
Gemini 3.5 Flash3.6
Opus 4.63.4
Kimi K2.63.1
Gemini 3.1 Pro Preview2.7
GLM-5.11.0
Gemini 3.6 Flash0.2
Sonnet 4.6-0.1
GPT-5.6 Luna-0.3
GPT-5.6 Terra-0.3
Gemma 4 31B IT-1.0
Hy3-1.6
Qwen3.7-Plus-1.7
Qwen3.7-Max-1.9
DeepSeek-V4-Pro-3.6
MiMo-V2.5-Pro-3.8
Grok Build 0.1-4.4
DeepSeek-V4-Flash-4.9
MiniMax M3-5.7
Inkling-7.1
Gemini 3 Flash Preview-8.3
Grok 4.3-8.9
MiniMax M2.7-14.7
Nemotron 3 Ultra 550B A55B-15.0
Gemini 3.5 Flash-Lite-17.2
Loading Atlas data…