Atlas

Benchmarks

← All benchmarks

ARC-AGI-1

General QA · 2019-11-05

Concept-learning benchmark for abstraction and program-like reasoning from input-output examples.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview98.0
Claude Opus 597.5
GPT-5.6 Sol97.5
GPT-5.5 Pro96.5
GPT-5.6 Terra96.5
Gemini 3 Deep Think96.0
GPT-5.595.0
GPT-5.4 Pro94.5
Kimi K394.5
Opus 4.694.0
Opus 4.793.5
GPT-5.492.7
Opus 4.892.5
Gemini 3.5 Flash92.5
GPT-5.2 Pro90.5
Grok 4.2089.5
GPT-5.6 Luna88.0
Grok 4.587.2
Sonnet 4.686.5
Gemini 3 Flash Preview84.7
Inkling-Small84.0
Opus 4.580.0
Inkling79.5
GLM-5.277.0
Gemini 3 Pro Preview75.0
GPT-5.272.7
GPT-5 Pro70.2
Grok 466.7
Kimi K2.565.3
Sonnet 4.563.7
GPT-5.4 Mini63.7
MiniMax M2.563.7
DeepSeek-V3.257.0
o3-pro57.0
GPT-5 Mini54.3
GPT-5.4 Nano51.5
Grok 4 Fast48.5
Haiku 4.547.7
GLM-544.7
GPT-544.0
Loading Atlas data…