MineBench Conservative Rating
Games
MineBench evaluates spatial reasoning and construction quality by asking language models to turn natural-language prompts into Minecraft-style voxel builds. The builds are rendered for blind human pairwise voting, and this headline score is the public conservative Glicko-style rating: raw rating minus two rating deviations.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5.6 Sol Pro | 2000 |
| Claude Opus 5 | 1995 |
| Claude Fable 5 | 1887 |
| GPT-5.5 Pro | 1883 |
| GPT-5.5 | 1772 |
| Kimi K3 | 1686 |
| Opus 4.8 | 1686 |
| GPT-5.4 Pro | 1671 |
| GPT-5.4 | 1533 |
| GLM-5.2 | 1510 |
| Sonnet 5 | 1493 |
| Gemini 3.5 Flash | 1493 |
| Gemini 3.1 Pro Preview | 1479 |
| GPT-5.3-Codex | 1470 |
| GPT-5.2 Pro | 1422 |
| Gemini 3.6 Flash | 1419 |
| Opus 4.7 | 1409 |
| Grok 4.5 | 1383 |
| GPT-5.2 | 1349 |
| GLM-5.1 | 1332 |
| Opus 4.6 | 1281 |
| GPT-5.4 Mini | 1261 |
| DeepSeek-V4-Pro | 1234 |
| Kimi K2.6 | 1211 |
| Gemini 3.5 Flash-Lite | 1191 |
| Sonnet 4.6 | 1175 |
| Opus 4.5 | 1159 |
| Gemini 3 Flash Preview | 1131 |
| Gemini 3 Pro Preview | 1127 |
| Grok 4.20 | 1088 |
| Qwen3.5 397B A17B | 1080 |
| GPT-5.4 Nano | 1044 |
| Kimi K2.5 | 1043 |
| Gemma 4 31B IT | 1036 |
| GLM-5 | 1026 |
| MiniMax M2.7 | 1016 |
| Sonnet 4.5 | 997 |
| GLM-4.7 | 996 |
| Gemini 2.5 Pro | 952 |
| Grok 4.3 | 938 |