Atlas

Benchmarks

← All benchmarks

TxBench Oligo Discovery V1

Science

TxBench-Oligo-Discovery V1: 113 deterministic evaluation tasks using experimental biological data. Published pass rates distinguish model and agent harness.

Top models (higher is better)

ModelScore
GPT-6 Astra55.5
Claude Opus 548.1
Grok 4.644.0
Opus 4.839.9
Sonnet 539.3
Gemini 3.5 Flash38.6
Grok 4.538.4
GPT-5.6 Sol34.5
DeepSeek V4.1 Flash33.9
GPT-5.533.6
GPT-5.6 Terra33.3
GPT-5.6 Luna23.9
Loading Atlas data…