Terminal-Bench 2.0
Agents · 2025-11-07
Terminal-Bench 2.0 evaluates terminal agents on 89 high-quality command-line tasks across software engineering, machine learning, security, data science, and related domains. Scores are reported as task accuracy or completion rate, with higher scores indicating more tasks solved.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5.5 | 84.7 |
| Claude Mythos Preview | 82.0 |
| Opus 4.7 | 80.2 |
| Gemini 3.1 Pro Preview | 80.2 |
| GPT-5.3-Codex | 78.4 |
| Opus 4.6 | 76.4 |
| GPT-5.4 | 75.1 |
| Opus 4.8 | 70.0 |
| Gemini 3 Pro Preview | 69.4 |
| Gemini 3.5 Flash | 67.4 |
| GPT-5.2-Codex | 66.5 |
| GPT-5.2 | 64.9 |
| Gemini 3 Flash Preview | 64.3 |
| Opus 4.5 | 63.1 |
| GPT-5.1-Codex mini | 61.6 |
| GPT-5.1-Codex-Max | 60.4 |
| GPT-5.4 Mini | 60.0 |
| Sonnet 4.6 | 59.6 |
| Muse Spark | 59.6 |
| Qwen3.7-Max | 59.2 |
| GPT-5.3-Codex-Spark | 58.4 |
| GPT-5.1-Codex | 57.8 |
| Kimi K2.6 | 57.3 |
| Grok 4.20 | 57.3 |
| DeepSeek-V4-Pro | 56.2 |
| GLM-5.1 | 53.9 |
| GLM-5 | 52.4 |
| Qwen3.6-Max-Preview | 51.7 |
| GPT-5 | 49.6 |
| GPT-5.1 | 47.6 |
| MiniMax M2.7 | 47.2 |
| Sonnet 4.5 | 46.5 |
| GPT-5.4 Nano | 46.3 |
| MiniMax M3 | 46.1 |
| Qwen3.6 27B | 44.9 |
| Qwen3.6 Plus (2026-04-02) | 44.9 |
| GPT-5-Codex | 44.3 |
| Grok 4.3 | 43.4 |
| Kimi K2.5 | 43.2 |
| MiniMax M2.5 | 42.7 |