Atlas

Benchmarks

← All benchmarks

ARC-AGI-3 (Semi-Private)

General QA · 2026-03-25

ARC Prize's semi-private ARC-AGI-3 interactive reasoning evaluation, where agents must explore, infer goals, plan, and act in novel game-like environments. Scores are normalized against human action efficiency.

Top models (higher is better)

ModelScore
Claude Opus 530.2
GPT-5.6 Sol7.8
GPT-5.6 Terra0.8
Opus 4.60.5
GPT-5.50.4
Gemini 3.1 Pro Preview0.4
Grok 4.50.3
GPT-5.40.2
Opus 4.70.2
GPT-5.6 Luna0.2
Grok 4.200.1
Loading Atlas data…