Atlas

Benchmarks

← All benchmarks

FrontierSWE (Dominance)

Code · 2026-04-16

FrontierSWE is an ultra-long-horizon software-engineering benchmark scored by model performance on difficult repository-level tasks.

Top models (higher is better)

ModelScore
Claude Fable 590.0
Kimi K381.2
Opus 4.878.0
Grok 4.578.0
GPT-5.576.0
GLM-5.272.0
GPT-5.6 Sol71.3
Opus 4.766.0
Opus 4.659.0
GPT-5.456.0
Gemini 3.1 Pro Preview41.0
Composer 2.538.0
GLM-5.132.0
DeepSeek-V4-Pro31.0
Kimi K2.628.0
Kimi K2.527.0
Qwen3.6 Plus (2026-04-02)24.0
Loading Atlas data…