Atlas

Benchmarks

← All benchmarks

EQ-Bench 3

Chat & Writing · 2025-04-28

EQ-Bench 3 is a multi-turn emotional-intelligence benchmark whose primary leaderboard score is normalized Elo from pairwise LLM-judge comparisons over role-play and analysis scenarios.

Top models (higher is better)

ModelScore
Claude Fable 52050
Opus 4.82030
Opus 4.71884
Opus 4.61717
Sonnet 4.61714
Hivemind-32B-Preview1618
GPT-5.51577
GLM-5.21575
DeepSeek-V4-Pro1570
GLM-5.11567
GPT-5.41563
Kimi K2 Instruct1562
Kimi K2.61561
Gemini 3 Pro Preview1559
GPT-5.21559
Horizon Alpha1554
GPT-5.11551
Opus 4.51546
Gemini 2.5 Pro Preview 06-051545
Kimi K2.51545
Gemini 3.1 Pro Preview1538
GLM-51526
Sonnet 4.51511
o31500
DeepSeek-V4-Flash1491
GPT-5 Chat (2025-08-07)1488
Gemma 4 31B IT1434
Gemma 4 26B A4B IT1431
GLM-4.71428
Qwen3.5 397B A17B1413
Opus 41400
Gemini 2.5 Pro Preview 03-251393
GPT-5.3 Instant1393
ChatGPT-4o (2025-04-25 update)1390
ChatGPT-4o Latest observed 2025-03-271387
Hermes 4 405B1361
Gemma 4 12B IT1361
GLM-4.51276
Sonnet 41243
O4 Mini1233
Loading Atlas data…