Atlas

Benchmarks

← All benchmarks

Terminal-Bench Science — Earth Sciences (Vals)

Science · 2026-09-23

Eight earth-science tasks under Vals' Terminus 2 protocol with infrastructure/provider-error retries.

Top models (higher is better)

ModelScore
GPT-6 Astra62.5
Claude Opus 5.550.0
Claude Fable 5.137.5
Opus 4.825.0
Claude Opus 525.0
Claude Fable 512.5
Gemini 3.5 Flash12.5
GPT-5.6 Sol12.5
GPT-5.6 Terra12.5
Grok 4.712.5
MiMo-V2.6-Pro12.5
Muse Spark 1.312.5
Sonnet 50.0
DeepSeek V4.1 Flash0.0
DeepSeek-V4-Flash-07310.0
DeepSeek V4 Pro 08130.0
Gemini 3.6 Flash0.0
Gemini 3.7 Flash0.0
Gemini 3.8 Flash0.0
GLM-5.3 Flash0.0
GLM-5.30.0
GPT-5.6 Luna0.0
Grok 4.60.0
Hy4 Preview0.0
Kimi K30.0
Mercury 2.50.0
MiMo-V2.6-Flash0.0
Qwen3.8 27B0.0
Loading Atlas data…