Atlas

Benchmarks

← All benchmarks

ALE-Bench

Code · 2025-06-17

ALE-Bench evaluates coding agents on improving algorithmic solutions under an execution-based optimization harness. The leaderboard reports aggregate performance scores, with higher values indicating better solutions.

Top models (higher is better)

ModelScore
Claude Fable 52463
GPT-5.6 Sol2410
Claude Opus 52165
GPT-5.6 Terra2154
GPT-5.52108
Opus 4.82102
Gemini 3.1 Pro Preview2041
Kimi K31991
GPT-5.3-Codex1934
Opus 4.71897
GPT-5.6 Luna1829
Gemini 3.6 Flash1825
GPT-5.41811
Sonnet 51783
Sonnet 4.61768
Gemini 3 Pro Preview1729
Gemini 3 Flash Preview1722
GPT-5.21715
Gemini 3.5 Flash1712
Kimi K2.61695
GPT-5.2-Codex1686
GLM-5.21685
GLM-5.11646
Opus 4.61607
Qwen3.7-Max1548
GPT-51545
GPT-5.1-Codex-Max1538
GPT-5.1-Codex1528
Hy31516
DeepSeek-V4-Pro1489
GPT-5.4 Mini1487
Grok 4.51467
Opus 4.51429
GPT-5.11425
Kimi K2.7 Code1422
GPT-5 Mini1421
Gemma 4 31B IT1394
Grok 4.201388
DeepSeek-V4-Flash1380
MiMo-V2-Pro1347
Loading Atlas data…