Atlas

Benchmarks

← All benchmarks

EpiBench V2

Science

EpiBench V2 clean-v1 reruns on 106 epigenomics evaluation tasks. Macro-mean pass rate on updated evaluation sets, distinct from V1.

Top models (higher is better)

ModelScore
Claude Opus 5.539.0
GPT-5.528.3
GPT-6 Astra28.3
Opus 4.825.8
GPT-5.6 Sol25.8
Claude Opus 525.2
Grok 4.623.6
Opus 4.722.6
Gemini 3.7 Flash22.0
GPT-6 Sol22.0
Sonnet 521.7
Gemini 3.8 Flash21.4
Grok 4.720.8
GPT-5.6 Luna19.8
GPT-6 Luna19.2
Sonnet 4.618.9
Loading Atlas data…