Atlas

Benchmarks

← All benchmarks

EQ-Bench 3: Moralising

Chat & Writing · 2025-04-28

Within EQ-Bench 3's emotional-intelligence scenarios, this subscore rates the moralising dimension of model responses on a 0–10 scale. Lower values are better.

Top models (lower is better)

ModelScore
Gemini 2.5 Flash Preview 05-202.5
Gemini 2.5 Pro Preview 03-252.6
GPT-5.3 Instant2.6
GPT-5 Chat (2025-08-07)2.7
Sonnet 4.62.9
Gemini 2.5 Pro Preview 05-062.9
Gemma 2 9B IT3.0
Grok 33.0
Horizon Alpha3.1
Llama 4 Maverick Instruct3.1
o33.2
ChatGPT-4o (2025-04-25 update)3.3
Opus 4.73.4
Opus 4.83.4
Gemini 2.5 Pro Preview 06-053.4
GPT-5.13.4
Llama 3.1 405B Instruct3.4
GPT-4.1 Mini3.5
Hivemind-32B-Preview3.5
Llama 4 Scout Instruct3.5
GPT-5.23.6
Opus 4.53.8
Grok 43.8
Claude Fable 53.9
Gemini 2.0 Flash 0013.9
GPT-4.13.9
GPT-5.43.9
O4 Mini3.9
Qwen2.5 72B Instruct3.9
ChatGPT-4o Latest observed 2025-03-274.0
GLM-54.0
gpt-oss-120b4.0
Grok 4.1 Fast4.0
DeepSeek-R14.1
DeepSeek-V3-03244.1
Grok 3 Mini4.1
gpt-oss-20b4.2
Kimi K2 Instruct4.2
Llama 3.2 1B Instruct4.2
DeepSeek-V4-Flash4.3
Loading Atlas data…