Atlas

Benchmarks

← All benchmarks

Terminal-Bench 2.1 - Hard

Agents · 2026-05-06

The Hard split of Terminal-Bench 2.1 reports the percentage of hard terminal-use tasks completed successfully; higher scores are better.

Top models (higher is better)

ModelScore
Claude Opus 584.4
GPT-5.6 Sol84.4
Kimi K374.4
Claude Fable 570.0
GPT-5.6 Luna70.0
GPT-5.566.7
Gemini 3.6 Flash64.4
Opus 4.863.3
GPT-5.6 Terra63.3
Gemini 3.1 Pro Preview60.0
Gemini 3.5 Flash60.0
Sonnet 557.8
Grok 4.556.7
Muse Spark 1.152.2
GLM-5.251.1
Kimi K2.7 Code45.6
Qwen3.7-Max44.4
Opus 4.740.0
Composer 2.540.0
Gemini 3 Flash Preview40.0
MiMo-V2.5-Pro40.0
GLM-5.137.8
MiMo-V2.536.7
Sonnet 4.634.4
GPT-5.4 Mini34.4
DeepSeek-V4-Pro31.1
Gemini 3.5 Flash-Lite31.1
Qwen3.6 Plus (2026-04-02)31.1
MiniMax M330.0
GPT-5.4 Nano25.6
Kimi K2.625.6
Nemotron 3 Ultra 550B A55B24.4
Inkling23.3
Qwen3.7-Plus23.3
Haiku 4.522.2
MiniMax M2.718.9
Grok 4.2016.7
Gemini 3.1 Flash-Lite Preview15.6
Mistral Medium 3.515.6
Grok 4.314.4
Loading Atlas data…