SpatialBench
Science · 2025-11-13
SpatialBench evaluates agents on 159 verifiable spatial-transcriptomics analysis tasks across 5 platforms and 7 task categories. Deterministic graders report the percentage of task runs passed.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5.5 | 57.6 |
| GPT-5.4 | 57.4 |
| Gemini 3.5 Flash | 55.6 |
| Opus 4.8 | 55.4 |
| Opus 4.6 | 52.8 |
| Opus 4.7 | 52.4 |
| Gemini 3.1 Pro Preview | 51.6 |
| GPT-5.2 | 50.1 |
| Grok 4.20 | 45.9 |
| Sonnet 4.6 | 44.2 |
| Opus 4.5 | 42.8 |
| Sonnet 4.5 | 41.5 |
| GPT-5.1 | 39.8 |
| Grok 4.1 Fast | 34.0 |
| Grok 4 | 31.9 |
| Gemini 2.5 Pro | 28.9 |