ALE-Bench
Code · 2025-06-17
ALE-Bench evaluates coding agents on improving algorithmic solutions under an execution-based optimization harness. The leaderboard reports aggregate performance scores, with higher values indicating better solutions.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 2463 |
| GPT-5.6 Sol | 2410 |
| Claude Opus 5 | 2165 |
| GPT-5.6 Terra | 2154 |
| GPT-5.5 | 2108 |
| Opus 4.8 | 2102 |
| Gemini 3.1 Pro Preview | 2041 |
| Kimi K3 | 1991 |
| GPT-5.3-Codex | 1934 |
| Opus 4.7 | 1897 |
| GPT-5.6 Luna | 1829 |
| Gemini 3.6 Flash | 1825 |
| GPT-5.4 | 1811 |
| Sonnet 5 | 1783 |
| Sonnet 4.6 | 1768 |
| Gemini 3 Pro Preview | 1729 |
| Gemini 3 Flash Preview | 1722 |
| GPT-5.2 | 1715 |
| Gemini 3.5 Flash | 1712 |
| Kimi K2.6 | 1695 |
| GPT-5.2-Codex | 1686 |
| GLM-5.2 | 1685 |
| GLM-5.1 | 1646 |
| Opus 4.6 | 1607 |
| Qwen3.7-Max | 1548 |
| GPT-5 | 1545 |
| GPT-5.1-Codex-Max | 1538 |
| GPT-5.1-Codex | 1528 |
| Hy3 | 1516 |
| DeepSeek-V4-Pro | 1489 |
| GPT-5.4 Mini | 1487 |
| Grok 4.5 | 1467 |
| Opus 4.5 | 1429 |
| GPT-5.1 | 1425 |
| Kimi K2.7 Code | 1422 |
| GPT-5 Mini | 1421 |
| Gemma 4 31B IT | 1394 |
| Grok 4.20 | 1388 |
| DeepSeek-V4-Flash | 1380 |
| MiMo-V2-Pro | 1347 |