RuneBench
Games · 2026-02-26
RuneBench evaluates coding agents that play an emulated RuneScape world by writing and executing TypeScript against rs-sdk while consulting extracted game-wiki files. Its headline 30-minute skill score is the mean of ln(1 + peak XP/min) across 16 skills; published sub-tasks also cover peak gold accumulation from four starting conditions.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 5.9 |
| GPT-5.6 Sol | 5.9 |
| Grok 4.5 | 5.7 |
| GPT-5.5 | 5.7 |
| Gemini 3.5 Flash | 5.4 |
| GPT-5.6 Luna | 5.3 |
| Opus 4.8 | 5.1 |
| Sonnet 5 | 4.8 |
| GLM-5.2 | 4.8 |
| Opus 4.7 | 4.7 |
| GPT-5.4 | 4.7 |
| Gemini 3 Flash Preview | 4.7 |
| Gemini 3.1 Pro Preview | 4.5 |
| Opus 4.6 | 4.4 |
| Kimi K2.7 Code | 4.3 |
| DeepSeek-V4-Pro | 4.3 |
| GPT-5.3-Codex | 4.3 |
| GPT-5.4 Mini | 4.1 |
| Opus 4.5 | 4.1 |
| Qwen3.7-Max | 4.1 |
| Gemini 3 Pro Preview | 3.8 |
| Grok 4.3 | 3.7 |
| Kimi K2.6 | 3.6 |
| Sonnet 4.5 | 3.2 |
| Sonnet 4.6 | 3.2 |
| GPT-5.4 Nano | 2.3 |
| Kimi K2.5 | 2.1 |
| GLM-5 | 1.9 |
| Haiku 4.5 | 1.6 |
| Qwen3 Max (rolling alias) | 1.4 |
| Qwen3.5 35B A3B | 0.7 |