Atlas

Benchmarks

← All benchmarks

FrontierSWE: Optimizer Design (Best@5)

Code · 2026-04-16

Design a single optimizer that beats tuned AdamW across diverse ML workloads. FrontierSWE Best@5 is the highest multiplicative improvement among up to five independent long-horizon agent runs.

Top models (higher is better)

ModelScore
Claude Fable 53.8
Grok 4.53.4
GPT-5.53.2
Opus 4.73.0
GLM-5.22.8
Opus 4.82.7
Composer 2.52.6
GPT-5.42.5
Kimi K2.62.4
Opus 4.61.9
Kimi K2.51.5
GLM-5.11.4
DeepSeek-V4-Pro1.3
Qwen3.6 Plus (2026-04-02)1.3
Gemini 3.1 Pro Preview1.2
Loading Atlas data…