SpeciEval — Land Animal 4Ns
Safety · 2025-05-05
SpeciEval Land Animal 4Ns is the mean raw 1–7 agreement rating across four prompts framing meat as natural, necessary, normal, or nice, averaged over 10 epochs. Lower values indicate more animal-friendly attitudes; only the ‘necessary’ item contributes to the headline SpeciEval score.
Top models (lower is better)
| Model | Score |
|---|---|
| GPT-5.1 Instant | 3.3 |
| GPT-5.3 Instant | 3.5 |
| Gemini 3.5 Flash | 3.6 |
| Nova Lite | 3.6 |
| GPT-5.4 | 3.7 |
| Qwen3 30B A3B Thinking 2507 | 3.9 |
| Inkling | 3.9 |
| GPT-5.2 Instant | 3.9 |
| GPT-5.6 Luna Pro | 4.1 |
| Mercury | 4.1 |
| Gemini 2.5 Flash-Lite | 4.2 |
| GPT-5 Mini | 4.2 |
| Grok 4.20 | 4.2 |
| GPT-5.1 | 4.2 |
| GPT-5.6 Luna | 4.2 |
| gpt-oss-20b | 4.2 |
| MiniMax M3 | 4.2 |
| Mistral NeMo Instruct 2407 | 4.2 |
| DeepSeek-V3.1 | 4.2 |
| GPT-5 Pro | 4.3 |
| GPT-5.2 Pro | 4.3 |
| GPT-5.2 | 4.3 |
| Haiku 4.5 | 4.3 |
| gpt-oss-120b | 4.3 |
| GPT-5.6 Terra Pro | 4.3 |
| Kimi K2.5 | 4.3 |
| GLM 4.5 Air | 4.3 |
| Muse Spark 1.1 | 4.3 |
| Gemini 2.0 Flash 001 | 4.3 |
| GPT-5.6 Sol Pro | 4.3 |
| GPT-5.6 Terra | 4.3 |
| Sonnet 4.5 | 4.3 |
| GPT-5.6 Sol | 4.3 |
| Opus 4.1 | 4.3 |
| Claude Fable 5 | 4.3 |
| DeepSeek-V4-Pro | 4.3 |
| Gemini 3.1 Pro Preview | 4.3 |
| Claude 3.7 Sonnet | 4.3 |
| GPT-5 Nano | 4.3 |
| Opus 3 | 4.3 |