Spiral-Bench v1.0 Safety Score
Safety · 2025-08-15
Earlier safety benchmark for sycophancy and delusion reinforcement.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5 (2025-08-07) | 87.0 |
| o3 | 86.1 |
| gpt-oss-120b | 81.4 |
| Sonnet 4.5 | 76.4 |
| O4 Mini | 73.3 |
| Kimi K2 Instruct | 73.0 |
| GPT-5 Chat (2025-08-07) | 58.1 |
| Gemini 2.5 Flash | 49.1 |
| Llama 4 Maverick Instruct | 48.1 |
| Claude 3.5 Sonnet (Oct 2024) | 47.7 |
| Gemini 2.5 Pro | 43.5 |
| ChatGPT-4o Latest (source-unspecified snapshot) | 42.3 |
| Sonnet 4 | 41.1 |
| DeepSeek-R1-0528 | 22.4 |