Atlas

Benchmarks

← All benchmarks

LMArena Agent Arena Tool Hallucination

Agents · 2026-06-04

Signed percentage-point Agent Arena diagnostic signal for apparent nonexistent or inappropriate tool use. Values may be negative when hallucination behavior is below the leaderboard baseline; lower values indicate safer and more grounded tool use.

Top models (lower is better)

ModelScore
Gemma 4 31B IT-28.7
Opus 4.8-21.9
Gemini 3.5 Flash-1.9
DeepSeek-V4-Flash-0.9
Nemotron 3 Ultra 550B A55B0.2
Qwen3.7-Plus0.2
Gemini 3 Flash Preview0.2
MiMo-V2.5-Pro0.3
Hy30.3
Inkling0.4
Gemini 3.5 Flash-Lite0.4
GLM-5.10.5
DeepSeek-V4-Pro0.7
MiniMax M30.8
Qwen3.7-Max0.8
Grok Build 0.10.9
MiniMax M2.71.1
Grok 4.31.1
Sonnet 51.2
Opus 4.71.2
Sonnet 4.61.2
Gemini 3.1 Pro Preview1.3
Claude Opus 51.3
Muse Spark 1.11.3
Opus 4.61.3
GPT-5.51.3
Kimi K2.61.3
GPT-5.41.3
Gemini 3.6 Flash1.3
GPT-5.6 Terra1.3
Kimi K2.7 Code1.3
Grok 4.51.3
GPT-5.6 Sol1.3
Claude Fable 51.3
GPT-5.6 Luna1.3
GLM-5.21.3
Kimi K31.3
Loading Atlas data…