Atlas

Benchmarks

← All benchmarks

FrontierCode 1.0 Main - Score

Code · 2026-06-08

FrontierCode 1.0 Main weighted score on the 100 hardest tasks in the 150-task Extended set, including all 50 Diamond tasks. Maintainer-authored rubrics cover correctness, regression safety, test quality, scope, and code quality; a trial that fails any blocker criterion receives a zero score.

Top models (higher is better)

ModelScore
Claude Fable 546.8
Opus 4.834.3
GPT-5.525.5
Opus 4.723.8
Kimi K2.7 Code22.0
GLM-5.219.2
GPT-5.4 Mini17.8
Gemini 3.1 Pro Preview16.7
Kimi K2.616.0
Sonnet 4.615.1
Qwen3.6 Plus (2026-04-02)9.7
Kimi K2.56.9
MiniMax M2.76.0
SWE-1.65.5
MiniMax M2.55.3
Gemini 3.1 Flash-Lite Preview4.8
Loading Atlas data…