AHK-Eval Hidden Cases
Code · 2026-06-11
AHK-Eval Hidden Cases measures exact functional case accuracy across the suite's 181 hidden tests. It gives partial credit for cases passed within tasks that do not achieve the primary benchmark's all-cases task-pass criterion.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 100.0 |
| Opus 4.8 | 100.0 |
| Sonnet 4.6 | 99.4 |
| GPT-5.6 Sol Pro | 97.8 |
| GPT-5.5 | 97.2 |
| GPT-5.6 Sol | 97.2 |
| GPT-5.6 Luna Pro | 96.7 |
| Kimi K3 | 94.5 |
| GPT-5.6 Luna | 93.4 |
| GPT-5.6 Terra | 90.6 |
| GPT-5.6 Terra Pro | 89.5 |
| Kimi K2.6 | 89.5 |
| Gemini 3.1 Pro Preview | 89.0 |
| Grok 4.5 | 88.4 |
| Muse Spark 1.1 | 84.5 |
| Grok 4.3 | 80.1 |
| Aion 3.0 | 79.0 |
| MiniMax M3 | 74.0 |
| GLM-5.2 | 73.5 |
| GLM-5 | 71.8 |
| Aion 3.0 Mini | 66.3 |
| GPT-5.1 | 64.6 |
| Hy3 | 61.9 |
| DeepSeek-V4-Pro | 61.3 |
| Qwen3-Coder-480B-A35B-Instruct | 47.5 |
| Mistral Large 3 675B Instruct 2512 | 32.6 |
| Laguna XS 2.1 | 26.0 |