Atlas

Benchmarks

← All benchmarks

Concept Synth INDUCTION Challenge64 Holdout

General QA

Post-selection diagnostic for direct Round-1 Challenge64 formulas: train-correct responses verified correct on all available generated holdout worlds, divided by all 64 tasks. Tasks without verified holdout success receive no credit, including unavailable holdout worlds; missing outcomes remain unknown in the underlying records. Holdout results are never used for prompting or response selection.

Top models (higher is better)

ModelScore
GPT-6 Astra85.9
GPT-6.1 Sol65.6
Claude Opus 5.554.7
Claude Sonnet 5.540.6
GPT-6 Sol37.5
GPT-5.6 Sol29.7
Claude Fable 5.129.7
Claude Opus 526.6
GPT-5.6 Terra25.0
Claude Fable 523.4
Grok 4.623.4
Muse Spark 1.121.9
Grok 4.718.8
GPT-6 Luna18.8
Grok 417.2
GPT-5.414.1
Gemini 3.7 Flash14.1
Grok 4.512.5
Gemini 3.8 Flash12.5
GPT-5.6 Luna10.9
Muse Spark 1.210.9
Gemini 3.5 Flash9.4
DeepSeek V4 Pro 08137.8
Kimi K37.8
Grok 4.1 Fast7.8
DeepSeek-V4-Pro6.3
Opus 4.66.3
DeepSeek V4.1 Flash4.7
Gemini 3.6 Flash4.7
Kimi K2.7 Code4.7
Opus 4.84.7
Kimi K2.64.7
GPT-5.23.1
Sonnet 53.1
Grok 4.33.1
Gemini 3 Pro Preview1.6
DeepSeek-V3.21.6
Gemini 3.1 Pro Preview0.0
Opus 4.50.0
GPT-4o0.0
Loading Atlas data…