Atlas

Benchmarks

← All benchmarks

AHK-Eval Parse Success

Code · 2026-06-11

AHK-Eval Parse Success is the share of the 36 generated AutoHotkey v2 functions that pass the suite's parser gate before functional execution.

Top models (higher is better)

ModelScore
GPT-5.6 Sol Pro100.0
GPT-5.5100.0
GPT-5.6 Sol100.0
GPT-5.6 Luna Pro100.0
Claude Fable 5100.0
Kimi K3100.0
GPT-5.6 Luna100.0
GPT-5.6 Terra Pro100.0
Opus 4.8100.0
Aion 3.0 Mini100.0
GPT-5.1100.0
GPT-5.6 Terra97.2
Kimi K2.697.2
Muse Spark 1.197.2
Grok 4.397.2
Aion 3.097.2
Sonnet 4.697.2
GLM-597.2
DeepSeek-V4-Pro97.2
Gemini 3.1 Pro Preview94.4
Grok 4.594.4
GLM-5.294.4
MiniMax M391.7
Mistral Large 3 675B Instruct 251291.7
Hy388.9
Qwen3-Coder-480B-A35B-Instruct88.9
Laguna XS 2.172.2
Loading Atlas data…