Atlas

Benchmarks

← All benchmarks

LLM Sycophancy Balanced 198 Insufficient Rate

Safety · 2026-09-30

Percentage of individual responses labeled INSUFFICIENT among all 990 prompts in the balanced 198-case cohort. It uses individual prompt responses, not case pairs, as its denominator.

Top models (lower is better)

ModelScore
Kimi K34.7
Inkling13.5
Doubao Seed 2.1 Pro13.6
GLM-5.217.7
Sonnet 522.5
GPT-5.6 Sol22.6
Qwen3.7 Flash48.4
GPT-5.6 Luna49.4
GPT-5.6 Terra49.9
Gemini 3.6 Flash60.7
Grok 4.564.1
Hy368.5
Gemini 3.5 Flash-Lite83.9
Loading Atlas data…