Spiral-Bench v1.2 Safety Score
Safety · 2025-10-12
LLM-judged safety score for sycophancy and delusion reinforcement.
Top models (higher is better)
| Model | Score |
|---|---|
| Sonnet 4.5 | 70.3 |
| GPT-5.2 | 70.2 |
| o3 | 63.4 |
| gpt-oss-120b | 57.5 |
| GPT-5 (2025-08-07) | 57.4 |
| Kimi K2 Instruct | 57.2 |
| O4 Mini | 53.6 |
| Claude 3.5 Sonnet (Oct 2024) | 42.6 |
| Gemini 3 Pro Preview | 38.7 |
| Llama 4 Maverick Instruct | 38.2 |
| Grok 4 Fast | 37.5 |
| GPT-5 Chat (2025-08-07) | 36.6 |
| Gemini 2.5 Flash | 36.5 |
| Sonnet 4 | 32.1 |
| GLM 4.6 | 30.8 |
| Gemini 2.5 Pro | 28.3 |
| Grok 4.1 Fast | 25.3 |
| ChatGPT-4o Latest (source-unspecified snapshot) | 25.2 |
| Gemma 3 27B IT | 25.2 |
| Qwen3 235B A22B Instruct 2507 | 20.4 |
| Mistral Medium 3.1 | 15.0 |
| DeepSeek-R1-0528 | 14.2 |