Atlas

Benchmarks

← All benchmarks

HalluHard (All Domains Average)

Safety · 2026-02-01

Hallucination rate across legal, research, medical, and coding conversations.

Top models (lower is better)

ModelScore
Opus 4.530.2
GPT-5.431.9
GPT-5.238.2
Claude Fable 538.9
GLM-539.7
GPT-5.549.8
Gemini 3.1 Pro Preview57.1
Kimi K2.559.1
Opus 4.759.6
Sonnet 559.7
Opus 4.660.9
Gemini 3 Pro Preview61.9
Kimi K2.663.6
Sonnet 4.663.7
GPT-564.8
Sonnet 4.565.6
Gemini 3 Flash Preview69.5
GPT-5 Chat (2025-08-07)71.8
GLM-5.274.8
DeepSeek-V4-Pro74.9
Grok 475.3
DeepSeek-V3.275.8
GPT-5 Mini75.9
GLM-4.777.1
Haiku 4.579.5
Kimi K2 Thinking80.1
Nemotron 3 Ultra 550B A55B84.5
GPT-5 Nano85.1
Grok 4.1 Fast86.0
Loading Atlas data…