Atlas

Benchmarks

← All benchmarks

Terminal-Bench Science — Life Sciences (Vals)

Science · 2026-09-23

Nineteen life-science tasks under Vals' Terminus 2 protocol with infrastructure/provider-error retries.

Top models (higher is better)

ModelScore
GPT-6 Astra73.7
Claude Opus 5.552.6
Claude Fable 521.1
Claude Fable 5.115.8
Claude Opus 515.8
Gemini 3.8 Flash15.8
GPT-5.6 Sol15.8
Muse Spark 1.315.8
Gemini 3.7 Flash10.5
GPT-5.6 Luna10.5
Opus 4.85.3
DeepSeek V4.1 Flash5.3
Gemini 3.5 Flash5.3
Gemini 3.6 Flash5.3
GPT-5.6 Terra5.3
Grok 4.65.3
Kimi K35.3
MiMo-V2.6-Flash5.3
Sonnet 50.0
DeepSeek-V4-Flash-07310.0
DeepSeek V4 Pro 08130.0
GLM-5.3 Flash0.0
GLM-5.30.0
Grok 4.70.0
Hy4 Preview0.0
Mercury 2.50.0
MiMo-V2.6-Pro0.0
Qwen3.8 27B0.0
Loading Atlas data…