Atlas

Benchmarks

← All benchmarks

Terminal-Bench 4.0 — Security

Agents · 2026-09-22

Resolution rate on the five security tasks in Terminal-Bench 4.0.

Top models (higher is better)

ModelScore
GPT-5.6 Sol53.3
GPT-6 Astra53.3
Grok 4.753.3
GPT-5.6 Terra46.7
GLM-5.333.3
MiMo-V2.6-Flash33.3
Muse Spark 1.333.3
Gemini 3.7 Flash26.7
Gemini 3.8 Flash26.7
GLM-5.3 Flash26.7
Grok 4.626.7
MiMo-V2.6-Pro26.7
Opus 4.820.0
Hy4 Preview20.0
Kimi K320.0
Grok 4.513.3
Qwen3.8 27B13.3
DeepSeek-V4-Flash-07316.7
Gemini 3.6 Flash6.7
Sonnet 50.0
DeepSeek V4.1 Flash0.0
DeepSeek V4 Pro 08130.0
Gemini 3.5 Flash0.0
GPT-5.6 Luna0.0
Inkling0.0
Inkling-Small0.0
Mercury 2.50.0
Muse Spark 1.20.0
Loading Atlas data…