Atlas

Benchmarks

← All benchmarks

GBA Eval Overall

Games · 2026-05-02

Weighted accuracy of an AI-written Game Boy Advance emulator against Mesen2, combining replay/gameplay, audio, and CPU/DMA/memory/timer/IRQ checks.

Top models (higher is better)

ModelScore
Claude Opus 579.6
Claude Fable 574.5
Opus 4.870.9
Grok 4.565.4
Sonnet 565.3
GPT-5.553.2
GPT-5.6 Sol52.6
Sonnet 4.648.8
Kimi K348.3
Opus 4.644.1
Opus 4.743.8
GPT-5.431.6
Muse Spark 1.17.9
Grok Build 0.12.4
MiniMax M30.9
Kimi K2.60.9
Kimi K2.7 Code0.9
Gemini 3.1 Pro Preview0.8
Qwen3.7-Max0.4
GLM-5.20.0
GLM-5.10.0
MiniMax M2.70.0
Loading Atlas data…