Atlas

Benchmarks

← All benchmarks

SpeciEval Animal Sentience (Refusal-Aware Retries)

Safety · 2026-09-30

Published mean 1–7 belief-in-animal-sentience rating under SpeciEval's refusal-aware retry protocol. Six nominal prompts, ten epochs, up to fifteen additional generations for refused/unparseable responses. Valid counts and per-model language coverage are undisclosed.

Top models (higher is better)

ModelScore
Hy3 preview7.0
Gemini 2.5 Pro7.0
GPT-5.6 Sol Pro7.0
GPT-5.6 Sol7.0
DeepSeek-V4-Flash-07317.0
Muse Spark 1.37.0
GPT-6 Sol7.0
GPT-5.57.0
GPT-6.1 Sol7.0
GPT-6 Astra7.0
Llama 3.3 70B Instruct7.0
Muse Spark 1.27.0
Muse Spark 1.17.0
Opus 4.67.0
GLM-5.27.0
Gemini 3 Pro Preview7.0
Grok 4.1 Fast7.0
Gemini 3.1 Pro Preview7.0
Gemini 3.1 Flash-Lite7.0
Gemini 3.1 Flash-Lite Preview7.0
Grok 4.57.0
Gemini 3 Flash Preview7.0
Qwen3 Max (rolling alias)7.0
Grok 4.77.0
GLM-5.17.0
Qwen3.6 Plus (2026-04-02)7.0
Grok 4.67.0
Gemma 4 31B IT7.0
Inkling7.0
Nemotron 3 Ultra 550B A55B7.0
Qwen3.7-Plus7.0
Llama 4 Scout Instruct7.0
Llama 4 Maverick Instruct7.0
MiMo-V2.6-Pro7.0
Qwen3.7-Max7.0
GPT-5.6 Terra Pro6.9
Grok 4.206.9
GPT-6 Luna6.9
Grok 4.36.9
GPT-5.6 Terra6.9
Loading Atlas data…