Atlas

Benchmarks

← All benchmarks

EQ-Bench 3: Safety

Chat & Writing · 2025-04-28

Within EQ-Bench 3's emotional-intelligence scenarios, this subscore rates the safety dimension of model responses on a 0–10 scale. Higher values are better.

Top models (higher is better)

ModelScore
GPT-5.27.7
Grok 4.207.7
Horizon Alpha7.7
GPT-5.57.6
GPT-5.47.5
Kimi K2.57.3
o37.2
Kimi K2.67.0
Kimi K2 Instruct7.0
Claude Fable 56.9
Opus 4.66.9
Opus 4.86.7
Sonnet 46.7
Sonnet 4.66.7
Hivemind-32B-Preview6.7
Qwen3.5 397B A17B6.7
Claude 3.7 Sonnet6.6
Sonnet 4.56.6
Gemini 3.1 Pro Preview6.6
Gemini 3 Pro Preview6.6
Gemma 4 26B A4B IT6.6
GPT-4.16.6
GPT-5.16.6
gpt-oss-120b6.6
Gemma 4 31B IT6.5
GLM-4.76.5
Opus 4.56.4
Opus 4.76.4
GLM-5.16.4
Opus 46.3
GLM-5.26.3
Gemma 3 27B IT6.2
DeepSeek-V4-Pro6.1
GLM-4.56.1
O4 Mini6.1
Claude 3.5 Sonnet (Oct 2024)6.0
DeepSeek-R16.0
GPT-5 Chat (2025-08-07)6.0
Gemini 2.5 Pro Preview 05-065.9
GLM-55.9
Loading Atlas data…