Atlas

Benchmarks

← All benchmarks

SpatialBench-Long

Science · 2026-05-27

Long-context spatial transcriptomics benchmark on real tissue datasets, spanning multiple studies and spatial analysis tasks.

Top models (higher is better)

ModelScore
GPT-5.6 Sol38.9
GPT-5.6 Terra22.2
Grok 4.519.4
GPT-5.6 Luna18.1
Sonnet 512.5
Kimi K312.5
Opus 4.811.1
Gemini 3.5 Flash11.1
GPT-5.511.1
Opus 4.69.7
Opus 4.78.3
Grok 4.206.9
GPT-5.45.6
Kimi K2.65.6
Sonnet 4.64.2
Gemini 3.1 Pro Preview4.2
Grok 4.34.2
Gemini 2.5 Pro1.4
Loading Atlas data…