SnorkelSequences
Math · 2026-06-08
SnorkelSequences is a mathematical and compositional reasoning benchmark from Snorkel AI. It contains 250 procedurally generated sequence problems with programmatic ground truth and reports accuracy@1.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5 | 77.6 |
| GPT-5 Mini | 77.6 |
| GPT-5 Nano | 72.0 |
| GPT-5.4 | 71.6 |
| o3-mini | 71.2 |
| Gemini 2.5 Flash | 70.8 |
| Sonnet 4 | 70.4 |
| Grok 4 Fast | 70.2 |
| O4 Mini | 68.8 |
| Llama 3.3 Nemotron Super 49B V1.5 | 66.8 |
| Gemini 2.5 Pro | 66.0 |
| Opus 4 | 65.6 |
| o3 | 65.2 |
| Grok 4 | 63.2 |
| Llama 4 Maverick | 62.0 |
| Nova Premier | 51.8 |
| Llama 4 Scout | 48.4 |
| Claude 3.7 Sonnet | 47.6 |
| Magistral Medium 1.0 | 47.6 |
| Llama 3.3 Nemotron Super 49B V1 | 44.8 |
| Nova Pro | 41.2 |
| Nova Lite | 40.0 |
| Grok 3 | 39.2 |
| Llama 3.3 70B Instruct | 38.8 |
| Mistral Large 1.0 | 38.8 |
| Codestral 25.01 | 38.4 |
| GPT-4.1 | 36.8 |
| Llama 3.1 Nemotron 70B Instruct HF | 36.4 |
| Kimi K2 Thinking | 36.0 |
| Llama 3.1 405B Instruct | 35.2 |
| Nova Micro | 33.6 |
| Qwen3-235B-A22B | 28.0 |