Atlas

Benchmarks

← All benchmarks

EQ-Bench 3: Humanlike

Chat & Writing · 2025-04-28

Within EQ-Bench 3's emotional-intelligence scenarios, this subscore rates the humanlike dimension of model responses on a 0–10 scale. Higher values are better.

Top models (higher is better)

ModelScore
Opus 4.87.8
Opus 4.77.7
Hivemind-32B-Preview7.5
GLM-5.27.3
DeepSeek-V4-Pro7.2
GLM-57.2
Opus 4.56.9
Sonnet 4.66.9
GLM-5.16.9
Opus 4.66.8
Claude Fable 56.7
DeepSeek-V4-Flash6.7
Gemini 3.1 Pro Preview6.5
Gemini 2.5 Pro Preview 06-056.4
GLM-4.76.3
Sonnet 4.56.2
Gemini 3 Pro Preview6.2
Kimi K2 Instruct6.2
ChatGPT-4o Latest observed 2025-03-276.1
Opus 46.1
Gemini 2.5 Pro Preview 03-256.1
GPT-5 Chat (2025-08-07)6.1
ChatGPT-4o (2025-04-25 update)6.0
GPT-5.16.0
GPT-5.46.0
Sonnet 45.9
Gemma 4 31B IT5.9
Gemini 2.5 Pro Preview 05-065.8
GPT-5.55.8
Kimi K2.65.8
GPT-4.15.7
GPT-5.25.7
Hermes 4 405B5.7
Kimi K2.55.7
Gemma 4 12B IT5.6
o35.6
Qwen3-235B-A22B5.6
Gemma 3 27B IT5.4
Gemma 4 26B A4B IT5.3
GPT-5.3 Instant5.3
Loading Atlas data…