Atlas

Benchmarks

← All benchmarks

Arena Code WebDev — Simulations

Code

Arena Code WebDev rating for interactive simulations. Anonymous generated simulations are compared through blind pairwise user votes.

Top models (higher is better)

ModelScore
Claude Opus 51748
Kimi K31707
Claude Fable 51677
GLM-5.21609
Grok 4.51598
Opus 4.81588
DeepSeek-V4-Flash1581
Opus 4.71573
Opus 4.61567
GLM-5.11561
Gemini 3.6 Flash1560
Sonnet 51553
Muse Spark 1.11549
Hy31532
Sonnet 4.61525
Gemini 3.5 Flash1517
Kimi K2.61500
MiMo-V2.5-Pro1487
Gemini 3.1 Pro Preview1471
Kimi K2.7 Code1471
MiniMax M31470
Qwen3.6 Plus (2026-04-02)1468
Opus 4.51464
Gemini 3 Pro Preview1452
DeepSeek-V4-Pro1446
GLM-51441
MiniMax M2.51436
MiMo-V2-Pro1434
GPT-5.41432
Kimi K2.51429
GPT-5.3-Codex1423
GPT-5.21419
Gemini 3 Flash Preview1417
MiMo-V2.51416
GPT-5.4 Mini1410
GLM-4.71403
Qwen3.5 397B A17B1390
MiniMax M2.71384
Sonnet 4.51383
GPT-51381
Loading Atlas data…