Atlas

Benchmarks

← All benchmarks

SpatialBench

Science · 2025-11-13

SpatialBench evaluates agents on 159 verifiable spatial-transcriptomics analysis tasks across 5 platforms and 7 task categories. Deterministic graders report the percentage of task runs passed.

Top models (higher is better)

ModelScore
GPT-5.557.6
GPT-5.457.4
Gemini 3.5 Flash55.6
Opus 4.855.4
Opus 4.652.8
Opus 4.752.4
Gemini 3.1 Pro Preview51.6
GPT-5.250.1
Grok 4.2045.9
Sonnet 4.644.2
Opus 4.542.8
Sonnet 4.541.5
GPT-5.139.8
Grok 4.1 Fast34.0
Grok 431.9
Gemini 2.5 Pro28.9
Loading Atlas data…