Atlas

Benchmarks

← All benchmarks

TxBench Antibody Discovery V1

Science

TxBench-Antibody-Discovery V1: 100 deterministic evaluation tasks using experimental biological data. Published pass rates distinguish model and agent harness.

Top models (higher is better)

ModelScore
GPT-6 Astra56.9
Claude Opus 553.0
Grok 4.651.9
Opus 4.845.6
Gemini 3.5 Flash42.6
Opus 4.739.0
DeepSeek V4.1 Flash39.0
Grok 4.538.9
Sonnet 537.3
GPT-5.6 Sol33.8
GPT-5.533.6
GPT-5.6 Terra31.0
GPT-5.6 Luna19.4
Loading Atlas data…