Atlas

Benchmarks

← All benchmarks

AHK-Eval Data Structures

Code · 2026-06-11

AHK-Eval Data Structures contains six independent AutoHotkey array, map, grouping, and aggregation tasks, scored by the share for which every hidden case passes.

Top models (higher is better)

ModelScore
GPT-5.6 Sol Pro100.0
GPT-5.5100.0
GPT-5.6 Sol100.0
GPT-5.6 Luna Pro100.0
Claude Fable 5100.0
Kimi K3100.0
Gemini 3.1 Pro Preview100.0
GPT-5.6 Luna83.3
GPT-5.6 Terra Pro83.3
Grok 4.583.3
Kimi K2.683.3
GPT-5.6 Terra66.7
Opus 4.866.7
GLM-566.7
GLM-5.266.7
Muse Spark 1.150.0
Grok 4.350.0
Aion 3.050.0
MiniMax M350.0
Sonnet 4.650.0
Hy350.0
GPT-5.133.3
DeepSeek-V4-Pro33.3
Qwen3-Coder-480B-A35B-Instruct33.3
Aion 3.0 Mini16.7
Mistral Large 3 675B Instruct 251216.7
Laguna XS 2.116.7
Loading Atlas data…