ARC-AGI-2
General QA · 2025-03-24
A harder successor to ARC-AGI that tests few-shot abstract reasoning and pattern generalization on grid-based tasks, with an added emphasis on efficiency of compute per task solved.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5.6 Sol | 92.5 |
| Claude Opus 5 | 90.4 |
| GPT-5.5 | 85.0 |
| GPT-5.5 Pro | 84.6 |
| GPT-5.6 Terra | 83.9 |
| Opus 4.7 | 75.8 |
| Gemini 3.5 Flash | 72.1 |
| Opus 4.8 | 71.7 |
| Opus 4.6 | 69.2 |
| Sonnet 4.6 | 60.4 |
| Kimi K3 | 60.4 |
| GPT-5.6 Luna | 59.5 |
| GPT-5.4 | 55.4 |
| Grok 4.5 | 52.6 |
| Inkling-Small | 40.1 |
| GPT-5.2 Pro | 38.5 |
| Opus 4.5 | 37.6 |
| Inkling | 36.5 |
| Gemini 3 Flash Preview | 33.6 |
| Gemini 3 Pro Preview | 31.1 |
| DeepSeek-V4-Pro | 28.3 |
| GPT-5.2 | 26.7 |
| GLM-5.2 | 22.8 |
| GPT-5.4 Mini | 18.9 |
| Kimi K2.6 | 18.1 |
| Grok 4 | 16.0 |
| GLM-5.1 | 15.0 |
| Sonnet 4.5 | 13.6 |
| Grok 4.3 | 13.3 |
| Kimi K2.5 | 11.8 |
| Opus 4 | 8.6 |
| GPT-5 | 7.5 |
| Grok 4.1 Fast | 6.7 |
| GPT-5.1 | 6.5 |
| GPT-5.4 Nano | 5.7 |
| Grok 4 Fast | 5.3 |
| DeepSeek-V3.2 | 5.0 |
| Kimi K2 Thinking | 5.0 |
| Gemini 2.5 Pro | 4.9 |
| GLM-5 | 4.9 |