Atlas

Benchmarks

← All benchmarks

Agent Red Teaming k=100 (CAIS)

Safety · 2025-07-28

Agent Red Teaming (ART) measures adversarial robustness of AI agents against malicious use and prompt-injection attacks. SAFE reports the probability that an attacker finds a successful attack after k=100 attempts, so lower is better.

Top models (lower is better)

ModelScore
Claude Fable 539.4
GPT-5.6 Sol40.3
GPT-5.541.5
Opus 4.542.5
Opus 4.744.5
Muse Spark 1.144.8
Gemini 3.1 Flash-Lite Preview45.4
Opus 4.847.0
Gemini 3 Pro Preview47.5
Opus 4.649.5
GPT-5.6 Terra54.6
Sonnet 4.654.8
GPT-5.459.7
GPT-5.6 Luna64.2
Sonnet 4.564.6
Gemini 3.1 Pro Preview68.0
GPT-5.268.8
Haiku 4.569.7
GLM-5.271.0
Gemini 3.5 Flash72.3
GPT-5.4 Mini74.3
GLM-5.175.8
Kimi K376.6
GPT-5.4 Nano81.7
GPT-5.182.1
Grok 4.583.5
GPT-5 Mini84.3
Grok 4.2084.6
Grok 485.9
Sonnet 486.6
GPT-5 Nano88.5
Grok 4.390.1
Grok 4.1 Fast90.2
GPT-4o (2024-11-20)90.7
Kimi K2.690.7
Kimi K2.590.9
DeepSeek-V4-Pro90.9
DeepSeek-R190.9
Gemini 2.5 Pro91.4
Gemini 2.5 Flash91.9
Loading Atlas data…