Atlas

Benchmarks

← All benchmarks

VariantBench V2

Science

VariantBench V2 clean-v1 reruns on 118 variant-analysis evaluations. Macro-mean pass rate on updated evaluation sets, distinct from V1.

Top models (higher is better)

ModelScore
Claude Opus 552.8
Claude Opus 5.550.6
GPT-6 Astra46.6
Grok 4.745.5
Opus 4.842.4
Grok 4.640.4
Sonnet 539.8
GPT-6 Sol38.7
GPT-5.6 Sol35.3
Opus 4.735.0
Gemini 3.7 Flash31.4
Gemini 3.8 Flash31.4
Sonnet 4.631.1
GPT-5.530.5
GPT-6 Luna27.7
GPT-5.6 Luna27.1
Loading Atlas data…