Atlas

Benchmarks

← All benchmarks

AHK-Eval Hidden Cases

Code · 2026-06-11

AHK-Eval Hidden Cases measures exact functional case accuracy across the suite's 181 hidden tests. It gives partial credit for cases passed within tasks that do not achieve the primary benchmark's all-cases task-pass criterion.

Top models (higher is better)

ModelScore
Claude Fable 5100.0
Opus 4.8100.0
Sonnet 4.699.4
GPT-5.6 Sol Pro97.8
GPT-5.597.2
GPT-5.6 Sol97.2
GPT-5.6 Luna Pro96.7
Kimi K394.5
GPT-5.6 Luna93.4
GPT-5.6 Terra90.6
GPT-5.6 Terra Pro89.5
Kimi K2.689.5
Gemini 3.1 Pro Preview89.0
Grok 4.588.4
Muse Spark 1.184.5
Grok 4.380.1
Aion 3.079.0
MiniMax M374.0
GLM-5.273.5
GLM-571.8
Aion 3.0 Mini66.3
GPT-5.164.6
Hy361.9
DeepSeek-V4-Pro61.3
Qwen3-Coder-480B-A35B-Instruct47.5
Mistral Large 3 675B Instruct 251232.6
Laguna XS 2.126.0
Loading Atlas data…