Atlas

Benchmarks

← All benchmarks

EQ-Bench 3: Warm

Chat & Writing · 2025-04-28

Within EQ-Bench 3's emotional-intelligence scenarios, this subscore rates the warm dimension of model responses on a 0–10 scale. Higher values are better.

Top models (higher is better)

ModelScore
ChatGPT-4o (2025-04-25 update)8.2
ChatGPT-4o Latest observed 2025-03-278.1
Grok 38.1
GPT-4.1 Mini8.0
Grok 48.0
Gemma 4 12B IT7.9
Gemini 2.5 Pro Preview 06-057.8
GPT-4.17.8
Grok 3 Mini7.8
Gemini 2.5 Pro Preview 05-067.7
Gemini 2.5 Pro Preview 03-257.6
GPT-4.57.6
Qwen3-235B-A22B7.6
DeepSeek-V4-Pro7.4
Gemini 3.1 Pro Preview7.4
Opus 4.87.3
Gemini 2.5 Flash Preview 05-207.3
Hivemind-32B-Preview7.3
GPT-4.1 Nano7.2
Grok 4.1 Fast7.2
o37.2
Opus 4.67.1
DeepSeek-V4-Flash7.1
GLM-57.1
GPT-5.17.1
Kimi K2 Instruct7.1
Claude Fable 57.0
GPT-5 Chat (2025-08-07)7.0
Llama 3.1 Nemotron Ultra 253B V17.0
QwQ-32B7.0
Opus 46.9
Sonnet 4.66.9
Gemma 4 26B A4B IT6.9
GLM-4.56.9
Opus 4.56.8
Opus 4.76.8
GPT-5.56.8
Horizon Alpha6.8
Qwen3.5 397B A17B6.8
GLM-5.26.6
Loading Atlas data…