Atlas

Benchmarks

← All benchmarks

Terminal-Bench Science — Physical Sciences (Vals)

Science · 2026-09-23

Seventeen physical-science tasks under Vals' Terminus 2 protocol with infrastructure/provider-error retries.

Top models (higher is better)

ModelScore
GPT-6 Astra52.9
Claude Fable 5.141.2
Claude Opus 5.535.3
Claude Opus 529.4
Muse Spark 1.329.4
Grok 4.723.5
Opus 4.817.6
GPT-5.6 Terra17.6
Claude Fable 511.8
Sonnet 511.8
DeepSeek V4.1 Flash11.8
Gemini 3.8 Flash11.8
GPT-5.6 Sol11.8
Gemini 3.5 Flash5.9
Gemini 3.7 Flash5.9
GLM-5.35.9
Grok 4.65.9
Hy4 Preview5.9
Kimi K35.9
MiMo-V2.6-Flash5.9
MiMo-V2.6-Pro5.9
Qwen3.8 27B5.9
DeepSeek-V4-Flash-07310.0
DeepSeek V4 Pro 08130.0
Gemini 3.6 Flash0.0
GLM-5.3 Flash0.0
GPT-5.6 Luna0.0
Mercury 2.50.0
Loading Atlas data…