Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Bash Recovery

Agents · 2026-06-04

Signed percentage-point Agent Arena diagnostic signal measuring how well the agent recovers after shell or command-line failures. Values may be negative when a model is below the leaderboard baseline; higher values indicate more robust agentic troubleshooting.

Top models (higher is better)

ModelScore
GPT-5.514.1
Claude Fable 513.9
Claude Opus 513.1
Opus 4.712.7
Sonnet 4.611.5
GPT-5.6 Luna10.9
Grok 4.510.9
Sonnet 510.9
Opus 4.610.3
GPT-5.49.4
GPT-5.6 Sol9.3
Opus 4.89.2
GPT-5.6 Terra8.8
Kimi K36.9
Muse Spark 1.16.2
Inkling5.9
Qwen3.7-Plus5.8
MiniMax M35.7
GLM-5.25.2
DeepSeek-V4-Pro4.8
Qwen3.7-Max4.6
DeepSeek-V4-Flash3.4
Hy31.4
MiMo-V2.5-Pro1.1
GLM-5.10.3
Gemini 3.6 Flash-0.6
Gemini 3.5 Flash-2.2
Kimi K2.7 Code-3.6
Kimi K2.6-6.6
Gemini 3.1 Pro Preview-10.2
Gemini 3.5 Flash-Lite-10.8
Grok 4.3-11.1
MiniMax M2.7-13.7
Grok Build 0.1-14.7
Nemotron 3 Ultra 550B A55B-16.6
Gemini 3 Flash Preview-18.7
Gemma 4 31B IT-38.5
Loading Atlas data…