Atlas

Benchmarks

← All benchmarks

LLM Sycophancy Balanced 198 Conditional Inconsistency

Safety · 2026-09-30

Sycophantic plus contrarian contradiction among decisive affective pairs in complete balanced-cohort runs. The denominator varies by model because INSUFFICIENT responses are excluded.

Top models (lower is better)

ModelScore
Hy34.2
Grok 4.510.0
GPT-5.6 Luna12.0
Gemini 3.6 Flash13.3
Gemini 3.5 Flash-Lite16.7
Qwen3.7 Flash16.9
GPT-5.6 Terra19.0
Doubao Seed 2.1 Pro22.4
Sonnet 522.5
Kimi K322.9
Inkling23.5
GPT-5.6 Sol25.3
GLM-5.229.5
Loading Atlas data…