Atlas

Benchmarks

← All benchmarks

MineBench Conservative Rating

Games

MineBench evaluates spatial reasoning and construction quality by asking language models to turn natural-language prompts into Minecraft-style voxel builds. The builds are rendered for blind human pairwise voting, and this headline score is the public conservative Glicko-style rating: raw rating minus two rating deviations.

Top models (higher is better)

ModelScore
GPT-5.6 Sol Pro2000
Claude Opus 51995
Claude Fable 51887
GPT-5.5 Pro1883
GPT-5.51772
Kimi K31686
Opus 4.81686
GPT-5.4 Pro1671
GPT-5.41533
GLM-5.21510
Sonnet 51493
Gemini 3.5 Flash1493
Gemini 3.1 Pro Preview1479
GPT-5.3-Codex1470
GPT-5.2 Pro1422
Gemini 3.6 Flash1419
Opus 4.71409
Grok 4.51383
GPT-5.21349
GLM-5.11332
Opus 4.61281
GPT-5.4 Mini1261
DeepSeek-V4-Pro1234
Kimi K2.61211
Gemini 3.5 Flash-Lite1191
Sonnet 4.61175
Opus 4.51159
Gemini 3 Flash Preview1131
Gemini 3 Pro Preview1127
Grok 4.201088
Qwen3.5 397B A17B1080
GPT-5.4 Nano1044
Kimi K2.51043
Gemma 4 31B IT1036
GLM-51026
MiniMax M2.71016
Sonnet 4.5997
GLM-4.7996
Gemini 2.5 Pro952
Grok 4.3938
Loading Atlas data…