Atlas

Benchmarks

← All benchmarks

SnorkelGraph

Math · 2026-06-08

SnorkelGraph is a graph-reasoning benchmark from Snorkel AI with 200 mathematical and spatial graph QA problems. Final answers are canonicalized and checked by a programmatic graph validator, with scores reported as accuracy@1.

Top models (higher is better)

ModelScore
GPT-5.484.5
Grok 4 Fast75.0
O4 Mini75.0
GPT-5 Mini72.5
GPT-572.0
o371.5
o3-mini71.0
Opus 464.5
Grok 364.0
GPT-4.163.0
GPT-5 Nano62.5
Qwen3-235B-A22B61.5
Grok 461.0
Sonnet 458.0
Gemini 2.5 Pro58.0
Gemini 2.5 Flash55.0
Magistral Medium 1.053.5
Claude 3.7 Sonnet50.0
Nova Premier34.5
Llama 4 Maverick34.0
Mistral Large 1.030.0
Llama 3.3 Nemotron Super 49B V129.0
Nova Pro28.0
Llama 4 Scout26.0
Codestral 25.0124.5
Llama 3.3 70B Instruct23.5
Llama 3.1 Nemotron 70B Instruct HF22.5
Llama 3.1 405B Instruct20.5
Nova Lite19.0
Nova Micro17.5
C4AI Command R+15.0
Loading Atlas data…