Atlas

Benchmarks

← All benchmarks

Terminal-Bench 2.0

Agents · 2025-11-07

Terminal-Bench 2.0 evaluates terminal agents on 89 high-quality command-line tasks across software engineering, machine learning, security, data science, and related domains. Scores are reported as task accuracy or completion rate, with higher scores indicating more tasks solved.

Top models (higher is better)

ModelScore
GPT-5.584.7
Claude Mythos Preview82.0
Opus 4.780.2
Gemini 3.1 Pro Preview80.2
GPT-5.3-Codex78.4
Opus 4.676.4
GPT-5.475.1
Opus 4.870.0
Gemini 3 Pro Preview69.4
Gemini 3.5 Flash67.4
GPT-5.2-Codex66.5
GPT-5.264.9
Gemini 3 Flash Preview64.3
Opus 4.563.1
GPT-5.1-Codex mini61.6
GPT-5.1-Codex-Max60.4
GPT-5.4 Mini60.0
Sonnet 4.659.6
Muse Spark59.6
Qwen3.7-Max59.2
GPT-5.3-Codex-Spark58.4
GPT-5.1-Codex57.8
Kimi K2.657.3
Grok 4.2057.3
DeepSeek-V4-Pro56.2
GLM-5.153.9
GLM-552.4
Qwen3.6-Max-Preview51.7
GPT-549.6
GPT-5.147.6
MiniMax M2.747.2
Sonnet 4.546.5
GPT-5.4 Nano46.3
MiniMax M346.1
Qwen3.6 27B44.9
Qwen3.6 Plus (2026-04-02)44.9
GPT-5-Codex44.3
Grok 4.343.4
Kimi K2.543.2
MiniMax M2.542.7
Loading Atlas data…