SpeciEval — Sea Animal 4Ns
Safety · 2025-05-05
SpeciEval Sea Animal 4Ns is the mean raw 1–7 agreement rating across four prompts framing seafood as natural, necessary, normal, or nice, averaged over 10 epochs. Lower values indicate more animal-friendly attitudes; only the ‘necessary’ item contributes to the headline SpeciEval score.
Top models (lower is better)
| Model | Score |
|---|---|
| GPT-5.4 | 3.6 |
| GPT-5.3 Instant | 3.7 |
| GPT-5.1 Instant | 3.8 |
| Nova Lite | 3.9 |
| GPT-5.6 Luna Pro | 4.1 |
| GPT-5.6 Terra Pro | 4.2 |
| Inkling | 4.2 |
| GPT-5.6 Terra | 4.3 |
| GPT-5 Pro | 4.3 |
| GPT-5.6 Luna | 4.3 |
| GPT-5.2 Pro | 4.3 |
| GPT-5.1 | 4.3 |
| GPT-5.2 | 4.3 |
| GPT-5.2 Instant | 4.3 |
| Kimi K2.5 | 4.3 |
| gpt-oss-20b | 4.3 |
| Muse Spark 1.1 | 4.3 |
| MiniMax M3 | 4.4 |
| GPT-5.6 Sol Pro | 4.4 |
| GPT-5 | 4.4 |
| GPT-5.6 Sol | 4.5 |
| Gemini 2.5 Flash-Lite | 4.5 |
| Kimi K2.6 | 4.5 |
| Opus 4.1 | 4.5 |
| Claude 3.7 Sonnet | 4.5 |
| Qwen3 30B A3B Thinking 2507 | 4.5 |
| Sonnet 4 | 4.5 |
| Opus 4 | 4.5 |
| Haiku 4.5 | 4.5 |
| GPT-5.5 | 4.5 |
| Nemotron 3 Ultra 550B A55B | 4.6 |
| GLM 4.5 Air | 4.6 |
| GPT-5 Mini | 4.6 |
| Grok 4.20 | 4.6 |
| GLM-5.1 | 4.6 |
| Grok 4.3 | 4.7 |
| Sonnet 4.5 | 4.7 |
| Opus 4.7 | 4.7 |
| DeepSeek-V4-Pro | 4.7 |
| DeepSeek-R1-0528 | 4.7 |