SlopCodeBench - Verbosity Mean
Code · 2026-01-20
Mean code verbosity, scaled to percent; lower is better.
Top models (lower is better)
| Model | Score |
|---|---|
| MiniMax M2.7 | 26.5 |
| GPT-5.5 | 26.9 |
| GPT-5.4 | 27.3 |
| Opus 4.5 | 29.7 |
| Kimi K2.5 | 30.9 |
| Sonnet 4.6 | 31.6 |
| Opus 4.6 | 31.8 |
| GLM-5.1 | 32.2 |
| GPT-5.4 Mini | 33.0 |
| GPT-5.3-Codex | 33.6 |
| Composer 2 | 35.3 |
| Opus 4.7 | 35.7 |
| GPT-5.3-Codex-Spark | 35.7 |
| GPT-5.2-Codex | 39.8 |
| Kimi K2.6 | 39.9 |