Atlas

Benchmarks

← All benchmarks

BioMysteryBench (Vals Terminus 2)

Science · 2026-09-22

Ninety bioinformatics mysteries evaluated by Vals with Terminus 2. Three trials per task; solved proportion averaged across trials. Content-filter, refusal and protocol failures count as failures.

Top models (higher is better)

ModelScore
Claude Opus 5.579.3
Claude Opus 579.3
GPT-6 Astra79.3
GPT-6 Sol74.8
Grok 4.672.2
Kimi K371.5
GPT-5.6 Sol71.1
Grok 4.769.3
Hy4 Preview69.3
DeepSeek V4.1 Flash67.8
Muse Spark 1.264.8
DeepSeek-V4-Flash-073164.4
Gemini 3.8 Flash62.2
GPT-5.6 Luna61.5
GPT-6 Luna61.5
Gemini 3.6 Flash58.5
Loading Atlas data…