Atlas

Benchmarks

← All benchmarks

Spiral-Bench v1.2 Safety Score

Safety · 2025-10-12

LLM-judged safety score for sycophancy and delusion reinforcement.

Top models (higher is better)

ModelScore
Sonnet 4.570.3
GPT-5.270.2
o363.4
gpt-oss-120b57.5
GPT-5 (2025-08-07)57.4
Kimi K2 Instruct57.2
O4 Mini53.6
Claude 3.5 Sonnet (Oct 2024)42.6
Gemini 3 Pro Preview38.7
Llama 4 Maverick Instruct38.2
Grok 4 Fast37.5
GPT-5 Chat (2025-08-07)36.6
Gemini 2.5 Flash36.5
Sonnet 432.1
GLM 4.630.8
Gemini 2.5 Pro28.3
Grok 4.1 Fast25.3
ChatGPT-4o Latest (source-unspecified snapshot)25.2
Gemma 3 27B IT25.2
Qwen3 235B A22B Instruct 250720.4
Mistral Medium 3.115.0
DeepSeek-R1-052814.2
Loading Atlas data…