Atlas

Benchmarks

← All benchmarks

Terminal-Bench 4.0 — Science

Agents · 2026-09-22

Resolution rate on the 14 science tasks in Terminal-Bench 4.0.

Top models (higher is better)

ModelScore
GPT-6 Astra57.1
Muse Spark 1.340.5
GLM-5.338.1
GLM-5.3 Flash31.0
GPT-5.6 Sol31.0
Opus 4.828.6
Grok 4.728.6
DeepSeek V4.1 Flash21.4
GPT-5.6 Terra21.4
MiMo-V2.6-Flash21.4
DeepSeek-V4-Flash-073119.0
MiMo-V2.6-Pro19.0
Grok 4.616.7
Gemini 3.8 Flash14.3
Grok 4.514.3
GPT-5.6 Luna11.9
Muse Spark 1.211.9
Sonnet 57.1
Gemini 3.5 Flash7.1
Gemini 3.6 Flash7.1
Kimi K37.1
Qwen3.8 27B7.1
Gemini 3.7 Flash4.8
DeepSeek V4 Pro 08132.4
Hy4 Preview2.4
Inkling0.0
Inkling-Small0.0
Mercury 2.50.0
Loading Atlas data…