Atlas

Benchmarks

← All benchmarks

Terminal-Bench 2.1 - Medium

Agents · 2026-05-06

The Medium split of Terminal-Bench 2.1 reports the percentage of medium-difficulty terminal-use tasks completed successfully; higher scores are better.

Top models (higher is better)

ModelScore
GPT-5.6 Sol86.1
Claude Fable 584.8
Claude Opus 583.6
GPT-5.6 Luna83.6
Kimi K383.6
Opus 4.782.4
Sonnet 581.8
GPT-5.581.2
Gemini 3.5 Flash80.0
GPT-5.6 Terra78.2
Muse Spark 1.178.2
Gemini 3.6 Flash77.0
Kimi K2.7 Code77.0
Opus 4.876.4
Gemini 3.1 Pro Preview75.2
GLM-5.274.5
Grok 4.572.1
MiMo-V2.570.9
Qwen3.7-Max68.5
Qwen3.7-Plus67.3
Sonnet 4.666.7
Kimi K2.666.7
Composer 2.565.5
GLM-5.165.5
MiMo-V2.5-Pro65.5
GPT-5.4 Mini64.2
MiniMax M364.2
Qwen3.6 Plus (2026-04-02)63.6
MiniMax M2.763.0
Nemotron 3 Ultra 550B A55B62.4
Gemini 3 Flash Preview60.0
DeepSeek-V4-Pro59.4
Gemini 3.5 Flash-Lite59.4
Inkling57.6
Grok 4.2056.4
Grok 4.354.5
Haiku 4.552.7
Mistral Medium 3.549.7
GPT-5.4 Nano47.3
Laguna M.142.4
Loading Atlas data…