Atlas

Benchmarks

← All benchmarks

SnorkelSequences

Math · 2026-06-08

SnorkelSequences is a mathematical and compositional reasoning benchmark from Snorkel AI. It contains 250 procedurally generated sequence problems with programmatic ground truth and reports accuracy@1.

Top models (higher is better)

ModelScore
GPT-577.6
GPT-5 Mini77.6
GPT-5 Nano72.0
GPT-5.471.6
o3-mini71.2
Gemini 2.5 Flash70.8
Sonnet 470.4
Grok 4 Fast70.2
O4 Mini68.8
Llama 3.3 Nemotron Super 49B V1.566.8
Gemini 2.5 Pro66.0
Opus 465.6
o365.2
Grok 463.2
Llama 4 Maverick62.0
Nova Premier51.8
Llama 4 Scout48.4
Claude 3.7 Sonnet47.6
Magistral Medium 1.047.6
Llama 3.3 Nemotron Super 49B V144.8
Nova Pro41.2
Nova Lite40.0
Grok 339.2
Llama 3.3 70B Instruct38.8
Mistral Large 1.038.8
Codestral 25.0138.4
GPT-4.136.8
Llama 3.1 Nemotron 70B Instruct HF36.4
Kimi K2 Thinking36.0
Llama 3.1 405B Instruct35.2
Nova Micro33.6
Qwen3-235B-A22B28.0
Loading Atlas data…