Atlas

Benchmarks

← All benchmarks

TxBench Antibody Discovery V2

Science

TxBench-Antibody-Discovery V2 clean-v1 reruns on 137 experimental-data evaluations. Macro-mean pass rate; the aggregate site's weight of 100 is not the task count.

Top models (higher is better)

ModelScore
GPT-6 Astra48.9
Grok 4.644.5
Gemini 3.7 Flash43.5
Gemini 3.8 Flash43.3
Grok 4.742.8
Claude Opus 541.9
GPT-6 Sol37.0
Opus 4.732.9
Opus 4.832.4
GPT-5.6 Sol31.4
Sonnet 530.4
GPT-5.529.9
GPT-6 Luna29.9
Sonnet 4.623.4
GPT-5.6 Luna19.2
Claude Opus 5.56.8
Loading Atlas data…