Atlas

Benchmarks

← All benchmarks

Terminal-Bench 2.0 - Medium

Agents · 2026-06-04

The Medium split of Terminal-Bench 2.0. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
GPT-5.579.3
Opus 4.877.0
Opus 4.772.7
Gemini 3.1 Pro Preview72.7
Gemini 3.5 Flash72.7
Opus 4.670.9
Opus 4.569.1
Sonnet 4.669.1
GPT-5.3-Codex69.1
GPT-5.469.1
Muse Spark69.1
Qwen3.7-Max67.9
DeepSeek-V4-Pro67.3
Kimi K2.667.3
Qwen3.6-Max-Preview67.3
Gemini 3 Pro Preview63.6
GLM-5.161.8
GLM-561.8
MiniMax M360.0
MiniMax M2.756.4
Qwen3.6 27B56.4
GPT-5.4 Mini53.9
Gemini 3 Flash Preview52.7
GPT-5.152.7
MiniMax M2.552.7
Qwen3.5 Plus (2026-02-15)52.7
Qwen3.6 Plus (2026-04-02)52.7
Grok 4.352.1
GPT-5.250.9
Sonnet 4.549.1
Grok 4.2049.1
Kimi K2.549.1
MiniMax M2.149.1
Haiku 4.547.3
DeepSeek-V3.247.3
GPT-5.4 Nano47.3
Kimi K2 Thinking47.3
Gemma 4 31B IT45.5
GPT-545.5
GLM-4.743.6
Loading Atlas data…