Atlas

Benchmarks

← All benchmarks

LLM Sycophancy Contrarian Rate

Safety · 2026-03-08

Contrarian rate measures how often a model shifts against the user-stated preference in paired sycophancy prompts. Lower values indicate more stable preference behavior.

Top models (lower is better)

ModelScore
Grok 4.30.0
Gemini 3.5 Flash0.5
Grok 4.200.5
GPT-4.10.5
MiniMax M31.0
ERNIE 5.01.5
Doubao Seed 2.0 Pro1.5
Mistral Large 3 675B Instruct 25122.0
Hy3 preview2.5
ERNIE 5.13.0
DeepSeek-V3.23.0
DeepSeek-V4-Pro3.5
Trinity Large Thinking4.0
GLM-5.15.0
Mistral Medium 3.55.0
Qwen3.7-Plus7.0
MiMo-V2.5-Pro7.5
Gemini 3.1 Flash-Lite Preview7.5
Kimi K2.57.5
MiniMax M2.77.5
Gemma 4 31B IT8.0
Qwen3.5 397B A17B8.5
Sonnet 4.68.5
Kimi K2.69.0
GPT-5.59.5
GLM-59.5
Opus 4.611.1
Opus 4.711.6
MiniMax M2.514.1
Qwen3.6-Max-Preview15.1
Claude Fable 520.1
Gemini 3.1 Pro Preview21.1
Loading Atlas data…