Atlas

Benchmarks

← All benchmarks

ScBench V2

Science

ScBench V2 clean-v1 reruns on 195 single-cell analysis evaluations. Macro-mean pass rate with updated evaluation sets, distinct from V1.

Top models (higher is better)

ModelScore
GPT-6 Astra63.9
GPT-6 Sol61.5
GPT-5.6 Sol59.8
Grok 4.659.1
Grok 4.758.5
Claude Opus 558.3
Opus 4.857.1
GPT-5.557.1
Claude Opus 5.556.4
Sonnet 555.6
GPT-6 Luna53.9
Opus 4.752.5
Gemini 3.7 Flash50.4
GPT-5.6 Luna50.3
Sonnet 4.641.7
Gemini 3.8 Flash34.0
Loading Atlas data…