Atlas

Benchmarks

← All benchmarks

GBENCH One-shot Coding GScore

Games · 2026-04-06

GBENCH One-shot Coding evaluates models by giving them complete descriptions of novel game environments and allowing one code submission with no retries. GScore combines percentile performance across games, successful execution, and a small response-time penalty on a 0-100 scale.

Top models (higher is better)

ModelScore
Claude Fable 565.1
GPT-5.6 Sol63.7
GPT-5.6 Terra61.7
Muse Spark 1.157.3
GPT-5.556.2
Opus 4.854.9
GPT-5.454.1
Gemini 3.5 Flash53.7
Gemini 3.1 Pro Preview53.6
Kimi K351.7
Gemini 3 Pro Preview50.8
Qwen3.7-Max48.7
Opus 4.648.6
GPT-5.3-Codex48.1
GPT-5.6 Luna48.0
Opus 4.747.8
Sonnet 4.647.3
GLM-5.247.2
Grok 4.547.0
GPT-5.146.6
Sonnet 546.1
GPT-5.245.9
Opus 4.544.5
MiMo-V2.5-Pro43.2
GLM-5.142.2
Qwen3.6-Max-Preview42.1
GPT-5.1-Codex41.0
GPT-5.2-Codex40.8
Kimi K2.640.3
GLM-4.739.6
Kimi K2.7 Code39.3
Gemini 2.5 Pro39.2
Gemini 3 Flash Preview38.8
Gemma 4 26B A4B IT37.1
GLM-537.0
DeepSeek-V4-Pro36.4
Grok 436.2
Grok Build 0.136.1
Kimi K2.536.0
MiniMax M336.0
Loading Atlas data…