Atlas

Benchmarks

← All benchmarks

Concept Synth INDUCTION Challenge100 Round 1

General QA

Challenge100 combines the frozen Challenge64 deck with disjoint New36 tasks. Train accuracy counts direct Round-1 train-valid formulas over all 100 problems. Missing, provider-error, incomplete and parser-invalid responses receive no credit. Response cascades select by parser evaluability, never correctness or holdout outcomes. Multi-formula responses succeed if any formula is train-valid. This aggregate takes priority over its overlapping Challenge64 component in capability fitting.

Top models (higher is better)

ModelScore
GPT-6 Astra94.0
GPT-6.1 Sol90.0
Claude Opus 5.565.0
GPT-6 Sol57.0
Claude Sonnet 5.544.0
GPT-5.6 Sol43.0
Claude Fable 5.133.0
Claude Fable 531.0
GPT-5.6 Terra25.0
Grok 4.625.0
Claude Opus 524.0
Grok 4.724.0
Muse Spark 1.121.0
GPT-6 Luna18.0
GPT-5.6 Luna16.0
DeepSeek V4 Pro 081315.0
Gemini 3.7 Flash11.0
Grok 4.511.0
Muse Spark 1.211.0
DeepSeek V4.1 Flash11.0
Gemini 3.8 Flash9.0
Gemini 3.5 Flash7.0
DeepSeek-V4-Pro6.0
Gemini 3.6 Flash5.0
Loading Atlas data…