Atlas

Benchmarks

← All benchmarks

Terminal-Bench 4.0 — ML

Agents · 2026-09-22

Resolution rate on the 11 machine-learning tasks in Terminal-Bench 4.0.

Top models (higher is better)

ModelScore
GPT-6 Astra57.6
Muse Spark 1.342.4
GPT-5.6 Terra36.4
Grok 4.736.4
GLM-5.330.3
MiMo-V2.6-Pro30.3
GLM-5.3 Flash27.3
Opus 4.824.2
GPT-5.6 Sol24.2
Grok 4.624.2
Kimi K321.2
MiMo-V2.6-Flash18.2
Gemini 3.8 Flash15.2
Hy4 Preview12.1
GPT-5.6 Luna9.1
DeepSeek V4.1 Flash6.1
Sonnet 53.0
Gemini 3.5 Flash3.0
Gemini 3.7 Flash3.0
Grok 4.53.0
Inkling-Small3.0
Muse Spark 1.23.0
Qwen3.8 27B3.0
DeepSeek-V4-Flash-07310.0
DeepSeek V4 Pro 08130.0
Gemini 3.6 Flash0.0
Inkling0.0
Mercury 2.50.0
Loading Atlas data…