Atlas

Benchmarks

← All benchmarks

TxBench Oligo Discovery V2

Science

TxBench-Oligo-Discovery V2 clean-v1 reruns on 120 experimental-data evaluations. Macro-mean pass rate; the aggregate site's weight of 113 is not the task count.

Top models (higher is better)

ModelScore
GPT-6 Astra49.2
Claude Opus 545.6
Grok 4.643.3
GPT-6 Sol40.6
Grok 4.740.3
Gemini 3.7 Flash35.6
Opus 4.835.3
GPT-5.6 Sol35.0
Sonnet 534.4
Gemini 3.8 Flash33.1
GPT-5.531.9
GPT-6 Luna31.7
Opus 4.730.0
Sonnet 4.628.3
GPT-5.6 Luna21.7
Claude Opus 5.51.4
Loading Atlas data…