Atlas

Benchmarks

← All benchmarks

Terminal-Bench Science — Mathematical Sciences (Vals)

Science · 2026-09-23

Seventeen mathematical-science tasks under Vals' Terminus 2 protocol with infrastructure/provider-error retries.

Top models (higher is better)

ModelScore
GPT-6 Astra88.2
Claude Opus 5.564.7
Claude Fable 5.147.1
Claude Opus 529.4
Claude Fable 511.8
GPT-5.6 Sol11.8
Grok 4.711.8
MiMo-V2.6-Flash11.8
Muse Spark 1.311.8
Opus 4.85.9
Gemini 3.7 Flash5.9
GLM-5.35.9
GPT-5.6 Luna5.9
GPT-5.6 Terra5.9
Sonnet 50.0
DeepSeek V4.1 Flash0.0
DeepSeek-V4-Flash-07310.0
DeepSeek V4 Pro 08130.0
Gemini 3.5 Flash0.0
Gemini 3.6 Flash0.0
Gemini 3.8 Flash0.0
GLM-5.3 Flash0.0
Grok 4.60.0
Hy4 Preview0.0
Kimi K30.0
Mercury 2.50.0
MiMo-V2.6-Pro0.0
Qwen3.8 27B0.0
Loading Atlas data…