Atlas

Benchmarks

← All benchmarks

Terminal-Bench 4.0 — Software

Agents · 2026-09-22

Resolution rate on the 18 software tasks in Terminal-Bench 4.0.

Top models (higher is better)

ModelScore
GPT-6 Astra55.6
GPT-5.6 Sol29.6
GPT-5.6 Terra27.8
MiMo-V2.6-Flash27.8
MiMo-V2.6-Pro27.8
Muse Spark 1.327.8
Grok 4.724.1
Kimi K322.2
DeepSeek V4.1 Flash18.5
Grok 4.616.7
Sonnet 514.8
DeepSeek-V4-Flash-073111.1
Gemini 3.8 Flash11.1
GLM-5.311.1
Opus 4.89.3
GLM-5.3 Flash9.3
Muse Spark 1.29.3
Gemini 3.6 Flash7.4
Gemini 3.5 Flash5.6
Gemini 3.7 Flash3.7
Grok 4.53.7
Inkling-Small3.7
Qwen3.8 27B3.7
GPT-5.6 Luna1.9
Hy4 Preview1.9
DeepSeek V4 Pro 08130.0
Inkling0.0
Mercury 2.50.0
Loading Atlas data…