Atlas

Benchmarks

← All benchmarks

Terminal-Bench 2.0 - Easy

Agents · 2026-06-04

The Easy split of Terminal-Bench 2.0. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Haiku 4.5100.0
Opus 4.5100.0
Opus 4.6100.0
Opus 4.7100.0
Gemini 2.5 Pro100.0
Gemini 3.1 Pro Preview100.0
Gemini 3.5 Flash100.0
Gemini 3 Flash Preview100.0
GPT-5.3-Codex100.0
GPT-5.4100.0
Grok 4.20100.0
Grok 4 Fast100.0
Opus 4.891.7
GPT-5.585.0
Qwen3.7-Max83.3
Sonnet 4.575.0
Sonnet 4.675.0
DeepSeek-V3.275.0
DeepSeek-V4-Pro75.0
Gemini 2.5 Flash Preview (09-2025)75.0
Gemini 3 Pro Preview75.0
Gemma 4 31B IT75.0
GLM 4.675.0
GLM-4.775.0
GLM-5.175.0
GLM-575.0
GPT-5.175.0
GPT-5.275.0
GPT-5.4 Mini75.0
GPT-5.4 Nano75.0
GPT-575.0
GPT-5 Mini75.0
Grok 475.0
Grok 4.1 Fast75.0
Kimi K2.575.0
Kimi K2.675.0
Laguna M.175.0
Laguna XS.275.0
MiniMax M2.575.0
MiniMax M2.775.0
Loading Atlas data…