Atlas

Benchmarks

← All benchmarks

TxBench Preclinical Pharmacology V2

Science

TxBench-Preclinical-Pharmacology V2 clean-v1 reruns on 100 experimental-data evaluations. Macro-mean pass rate on updated evaluation sets, distinct from V1.

Top models (higher is better)

ModelScore
Claude Opus 563.0
GPT-6 Sol63.0
Grok 4.661.7
GPT-5.6 Sol61.3
GPT-6 Astra59.3
Opus 4.857.7
Gemini 3.7 Flash55.3
GPT-5.555.3
Gemini 3.8 Flash54.7
Grok 4.754.7
Sonnet 549.3
Opus 4.745.3
GPT-6 Luna44.3
GPT-5.6 Luna43.7
Sonnet 4.634.3
Claude Opus 5.530.7
Loading Atlas data…