Atlas

Benchmarks

← All benchmarks

Frontier-Bench v0.1

Agents · 2026-07-22

Frontier-Bench v0.1 evaluates general-purpose agents on 74 difficult tasks across seven domains using rich terminal environments, GPU and multi-container workloads, open-internet access, and programmatic verifiers. Scores report mean reward for a named model, agent harness, and reasoning setting.

Top models (higher is better)

ModelScore
Claude Opus 544.4
GPT-5.6 Sol37.5
Claude Fable 533.8
Opus 4.821.1
GPT-5.6 Terra20.8
Grok 4.517.8
Sonnet 517.0
GPT-5.6 Luna14.3
GLM-5.25.1
Loading Atlas data…