Atlas

Benchmarks

← All benchmarks

Terminal-Bench 2.0 - Hard

Agents · 2026-06-04

The Hard split of Terminal-Bench 2.0. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
GPT-5.560.5
Opus 4.756.7
Opus 4.854.4
Gemini 3.1 Pro Preview53.3
Gemini 3.5 Flash53.3
GPT-5.250.0
GPT-5.3-Codex50.0
Gemini 3 Flash Preview43.3
Sonnet 4.640.0
Muse Spark40.0
Qwen3.7-Max40.0
Gemini 3 Pro Preview36.7
GLM-5.136.7
Kimi K2.636.7
Opus 4.533.3
DeepSeek-V4-Pro33.3
GPT-5.433.3
Opus 4.630.0
GPT-5.126.7
MiniMax M2.726.7
Qwen3.6 Plus (2026-04-02)26.7
GPT-5.4 Mini24.4
Grok 4.324.4
Sonnet 4.523.3
Gemma 4 31B IT23.3
GLM-4.723.3
GLM-523.3
GPT-5.4 Nano21.7
Kimi K2.520.0
Kimi K2 Instruct20.0
MiniMax M320.0
Qwen3.6 27B20.0
Qwen3.6-Max-Preview20.0
GPT-516.7
GPT-5 Mini16.7
Grok 4.2016.7
Kimi K2 Thinking16.7
MiniMax M2.516.7
Qwen3.5 Plus (2026-02-15)16.7
Haiku 4.513.3
Loading Atlas data…