Atlas

Benchmarks

← All benchmarks

Concept Synth INDUCTION Challenge100 Holdout

General QA

Post-selection diagnostic for direct Round-1 Challenge100 formulas: train-correct responses verified correct on all available generated holdout worlds, divided by all 100 tasks. Tasks without verified holdout success receive no credit, including unavailable holdout worlds; missing outcomes remain unknown in the underlying records. Holdout results are never used for prompting or response selection.

Top models (higher is better)

ModelScore
GPT-6 Astra79.0
GPT-6.1 Sol62.0
Claude Opus 5.550.0
Claude Sonnet 5.537.0
GPT-6 Sol35.0
Claude Fable 5.130.0
GPT-5.6 Sol22.0
Claude Opus 520.0
Claude Fable 519.0
GPT-5.6 Terra17.0
Grok 4.617.0
Grok 4.714.0
Muse Spark 1.114.0
GPT-6 Luna12.0
Gemini 3.7 Flash9.0
Grok 4.58.0
Gemini 3.8 Flash8.0
GPT-5.6 Luna7.0
Muse Spark 1.27.0
Gemini 3.5 Flash6.0
DeepSeek V4 Pro 08135.0
DeepSeek-V4-Pro4.0
DeepSeek V4.1 Flash3.0
Gemini 3.6 Flash3.0
Loading Atlas data…