Atlas

Benchmarks

← All benchmarks

FrontierSWE: Optimizer Design (Mean@5)

Code · 2026-04-16

Design a single optimizer that beats tuned AdamW across diverse ML workloads. FrontierSWE Mean@5 is the average multiplicative improvement across up to five independent long-horizon agent runs.

Top models (higher is better)

ModelScore
Grok 4.52.7
GLM-5.22.6
Opus 4.72.3
GPT-5.52.1
Opus 4.82.0
GPT-5.41.6
Opus 4.61.5
Composer 2.51.5
Kimi K2.61.5
GLM-5.11.3
DeepSeek-V4-Pro1.2
Gemini 3.1 Pro Preview1.1
Kimi K2.51.1
Qwen3.6 Plus (2026-04-02)0.9
Claude Fable 50.8
Loading Atlas data…