Atlas

Benchmarks

← All benchmarks

SpatialBench V2

Science

SpatialBench V2 clean-v1 reruns on 115 spatial-transcriptomics evaluations. Macro-mean pass rate; updated evaluation sets are not directly comparable to V1.

Top models (higher is better)

ModelScore
Claude Opus 5.572.8
Grok 4.769.6
Claude Opus 568.4
GPT-5.6 Sol68.1
GPT-6 Astra67.5
GPT-6 Sol67.5
Grok 4.667.3
Opus 4.867.0
Sonnet 566.7
GPT-5.564.1
GPT-5.6 Luna60.9
GPT-6 Luna59.7
Gemini 3.8 Flash59.4
Gemini 3.7 Flash59.1
Opus 4.756.5
Sonnet 4.653.9
Loading Atlas data…