Atlas

Benchmarks

← All benchmarks

Vibe Code Bench v1.1

Code · 2026-03-02

Web-app generation benchmark testing whether models can build usable applications from natural-language prompts.

Top models (higher is better)

ModelScore
Claude Fable 590.4
Claude Opus 588.4
Kimi K385.0
Opus 4.882.7
Sonnet 581.3
GPT-5.6 Sol80.5
GPT-5.6 Luna77.1
Muse Spark 1.172.2
Opus 4.771.0
GPT-5.569.8
Grok 4.569.0
GPT-5.6 Terra67.8
GPT-5.467.4
GLM-5.264.0
GPT-5.3-Codex61.8
Opus 4.657.6
Gemini 3.6 Flash57.3
Sonnet 4.655.8
GPT-5.253.5
DeepSeek-V4-Pro49.9
Composer 2.549.6
Gemini 3.5 Flash48.7
GPT-5.4 Mini48.0
Qwen3.7-Max47.7
MiniMax M347.6
Kimi K2.7 Code47.2
Qwen3.7-Plus46.4
MiMo-V2.542.2
GPT-5.2-Codex37.9
Kimi K2.637.9
Gemini 3.5 Flash-Lite37.2
MiMo-V2.5-Pro34.1
Gemini 3.1 Pro Preview32.0
GLM-5.131.5
GPT-5.4 Nano26.1
Qwen3.6 Plus (2026-04-02)25.6
GPT-5.124.6
GLM-523.4
Sonnet 4.522.6
GPT-5.1-Codex-Max22.2
Loading Atlas data…