Atlas

Benchmarks

← All benchmarks

Machiavelli Deception (CAIS)

Safety · 2023-04-06

Machiavelli measures harmful and deceptive behavior by LLM agents in goal-oriented text-based games. SAFE reports its deception measurements as a CAIS AI Dashboard risk component, where lower scores indicate less deceptive behavior; 100 is the random-policy baseline and values above 100 are possible for more deceptive behavior.

Top models (lower is better)

ModelScore
GPT-5 Nano79.4
Claude Fable 580.2
GPT-5.6 Terra80.4
Opus 4.580.8
Grok 4.1 Fast81.3
Haiku 4.581.5
Sonnet 4.581.6
GPT-5.581.7
GPT-5.6 Sol82.7
DeepSeek-V4-Pro83.0
Opus 4.883.7
Grok 4.2083.8
GPT-583.8
Kimi K2 Thinking84.2
GPT-5 Mini84.2
Opus 4.684.4
Grok 4.384.7
Sonnet 4.684.9
DeepSeek-R185.1
Opus 4.785.7
GPT-5.286.5
GLM-5.186.7
GPT-5.6 Luna87.9
Muse Spark 1.188.2
GPT-5.4 Nano88.5
Gemini 3.1 Pro Preview89.2
Gemini 2.5 Flash89.4
DeepSeek-V3.289.6
GPT-5.189.6
Grok 4.590.9
Kimi K2.692.1
Gemini 3.5 Flash92.3
GLM-5.292.3
Kimi K392.6
GPT-5.492.9
Grok 493.4
Kimi K2.593.5
Gemini 2.5 Pro95.3
Gemini 3 Flash Preview95.3
GPT-5.4 Mini95.6
Loading Atlas data…