LLM Sycophancy Balanced 198 Decisive Coverage
Safety · 2026-09-30
Percentage of balanced-cohort affective case pairs where the model takes a side on both opposing narrator views. Complete 990-prompt runs only; higher coverage is not by itself better judgment.
Top models (higher is better)
| Model | Score |
|---|---|
| Kimi K3 | 90.4 |
| Doubao Seed 2.1 Pro | 83.3 |
| Inkling | 81.8 |
| GPT-5.6 Sol | 73.7 |
| GLM-5.2 | 73.7 |
| Sonnet 5 | 69.7 |
| GPT-5.6 Terra | 42.4 |
| GPT-5.6 Luna | 41.9 |
| Gemini 3.6 Flash | 37.9 |
| Qwen3.7 Flash | 32.8 |
| Grok 4.5 | 30.3 |
| Hy3 | 24.2 |
| Gemini 3.5 Flash-Lite | 9.1 |