Atlas

Benchmarks

← All benchmarks

BioSecBench-Surveillance V2

Science

BioSecBench-Surveillance V2 clean-v1 reruns on 102 genomic surveillance evaluations. Macro-mean pass rate on updated evaluation sets, distinct from V1.

Top models (higher is better)

ModelScore
Claude Opus 5.558.5
Claude Opus 551.5
GPT-6 Astra48.5
Grok 4.648.0
Grok 4.748.0
GPT-6 Sol47.7
GPT-5.6 Sol47.3
GPT-5.547.1
Opus 4.846.9
Opus 4.745.8
Gemini 3.8 Flash44.1
GPT-5.6 Luna43.2
Gemini 3.7 Flash41.5
GPT-6 Luna41.5
Sonnet 539.0
Sonnet 4.634.5
Loading Atlas data…