Atlas

Benchmarks

← All benchmarks

SlopCodeBench - Core Solved

Code · 2026-01-20

SlopCodeBench evaluates code at a sequence of development checkpoints. Core Solved is the percentage of checkpoints whose core tests pass.

Top models (higher is better)

ModelScore
Opus 4.665.3
GPT-5.565.3
Opus 4.764.3
GPT-5.461.2
GPT-5.3-Codex59.2
Opus 4.556.1
Sonnet 4.656.1
GPT-5.2-Codex54.6
Composer 251.5
GPT-5.4 Mini51.0
Kimi K2.651.0
Kimi K2.539.8
GLM-5.138.8
GPT-5.3-Codex-Spark29.1
MiniMax M2.728.6
Loading Atlas data…