Atlas

Benchmarks

← All benchmarks

BioSecBench-Function V2

Science

BioSecBench-Function V2 clean-v1 reruns on 111 deterministic biological-function evaluations. Macro-mean pass rate on updated evaluation sets, distinct from V1.

Top models (higher is better)

ModelScore
Claude Opus 5.573.6
GPT-6 Astra48.6
Claude Opus 544.8
Grok 4.644.0
Grok 4.743.3
Opus 4.843.1
GPT-6 Sol39.3
Gemini 3.8 Flash36.0
GPT-5.6 Sol35.5
Sonnet 533.8
Gemini 3.7 Flash33.7
Opus 4.730.8
GPT-5.528.3
GPT-5.6 Luna27.6
Sonnet 4.627.3
GPT-6 Luna27.3
Loading Atlas data…