Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Praise vs Complaint

Agents · 2026-06-04

Signed percentage-point Agent Arena diagnostic signal comparing positive user feedback against complaints. Values may be negative when a model is below the leaderboard baseline; higher values indicate more favorable user reactions to the agent’s work.

Top models (higher is better)

ModelScore
Claude Opus 525.6
Claude Fable 524.4
GPT-5.6 Sol21.9
Opus 4.821.0
Kimi K317.5
Sonnet 516.1
GLM-5.213.8
GPT-5.512.9
Opus 4.712.3
Opus 4.610.1
Grok 4.55.7
GPT-5.6 Luna4.8
GPT-5.6 Terra4.5
GPT-5.43.5
Kimi K2.7 Code3.4
Hy32.8
Kimi K2.61.6
Gemini 3.1 Pro Preview1.3
Sonnet 4.60.9
GLM-5.10.5
Gemini 3.5 Flash-3.6
Gemma 4 31B IT-3.9
Muse Spark 1.1-4.6
DeepSeek-V4-Pro-5.4
Qwen3.7-Max-5.9
Gemini 3.6 Flash-6.2
Qwen3.7-Plus-8.0
MiMo-V2.5-Pro-8.1
DeepSeek-V4-Flash-8.4
MiniMax M3-9.0
Grok Build 0.1-10.6
Gemini 3 Flash Preview-11.8
Nemotron 3 Ultra 550B A55B-13.6
Grok 4.3-14.2
MiniMax M2.7-15.7
Inkling-15.8
Gemini 3.5 Flash-Lite-17.6
Loading Atlas data…