Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Steerability

Agents · 2026-06-04

Signed percentage-point Agent Arena diagnostic signal measuring how well the agent follows user steering and course corrections. Values may be negative when a model is below the leaderboard baseline; higher values indicate better controllability in interactive tasks.

Top models (higher is better)

ModelScore
Claude Fable 512.9
Opus 4.89.8
Kimi K39.7
Opus 4.79.6
GPT-5.59.2
GPT-5.6 Sol9.0
Opus 4.67.2
Sonnet 56.7
GPT-5.46.5
GLM-5.26.0
Claude Opus 55.5
Grok 4.55.1
GPT-5.6 Terra3.3
Sonnet 4.62.4
Gemini 3.1 Pro Preview2.4
GPT-5.6 Luna0.6
GLM-5.1-0.2
Qwen3.7-Max-0.2
DeepSeek-V4-Pro-0.4
Gemini 3.5 Flash-1.0
MiMo-V2.5-Pro-2.1
Gemini 3.6 Flash-2.6
Kimi K2.7 Code-3.7
DeepSeek-V4-Flash-4.0
MiniMax M3-4.6
Qwen3.7-Plus-4.6
Muse Spark 1.1-4.8
Kimi K2.6-4.9
Gemini 3 Flash Preview-5.4
Gemini 3.5 Flash-Lite-5.8
Grok 4.3-7.0
Hy3-8.2
Gemma 4 31B IT-8.5
Grok Build 0.1-11.1
Inkling-12.1
MiniMax M2.7-14.9
Nemotron 3 Ultra 550B A55B-20.7
Loading Atlas data…