Atlas

Benchmarks

← All benchmarks

SpeciEval — Speciesism

Safety · 2025-05-05

SpeciEval Speciesism is the mean raw 1–7 agreement rating across four prompts about human superiority over and use of farmed animals, averaged over 10 epochs. Lower values indicate less speciesist, more animal-friendly attitudes.

Top models (lower is better)

ModelScore
Hy3 preview1.0
Gemini 2.5 Pro1.1
GPT-5.6 Sol Pro1.1
GPT-5.6 Sol1.2
Qwen3 30B A3B Thinking 25071.2
GPT-5.6 Terra1.2
GPT-4.11.3
Grok 4.201.3
GPT-5.6 Terra Pro1.3
GPT-5.51.3
GPT-5.11.4
GPT-5 Chat (2025-08-07)1.4
o4-mini-deep-research (2025-06-26)1.4
Kimi K2 Instruct1.4
GLM 4.61.4
GPT-5 Pro1.4
Gemini 2.5 Flash-Lite1.5
Inkling1.5
Llama 3.3 70B Instruct1.5
GPT-5.2 Pro1.5
Qwen3 30B A3B Instruct 25071.5
Qwen3 Max (rolling alias)1.5
GPT-5.21.6
GLM-4.51.6
GPT-51.6
Nova Lite1.6
Kimi K2 Instruct 09051.6
MiniMax M2.71.6
Grok 41.6
Grok 3 Mini1.7
GLM 4.5 Air1.7
Kimi K2.51.7
Muse Spark 1.11.7
Nemotron 3 Ultra 550B A55B1.8
MiniMax M21.8
DeepSeek-V3.11.8
DeepSeek-V4-Pro1.8
Qwen3-30B-A3B1.8
Kimi K2.61.8
Kimi K31.8
Loading Atlas data…