Atlas

Benchmarks

← All benchmarks

Ruby LLM Program Fixer — Vending Machine

Code · 2025-08-01

The Vending Machine Program Fixer task asks a model to repair a broken Ruby vending-machine implementation against 31 tests. Its composite is 90% test success plus 10% RuboCop quality, with each offense subtracting two quality points down to zero.

Top models (higher is better)

ModelScore
GPT-5.579.1
GPT-5.6 Sol Pro79.1
GPT-5.278.9
GPT-5.6 Sol78.9
GPT-5.6 Terra78.9
GPT-5.6 Terra Pro78.9
Claude Opus 578.7
GPT-5.3-Codex78.7
GPT-5.478.7
GPT-5.6 Luna78.7
Kimi K2.678.7
Gemini 2.5 Pro78.5
GPT-5.6 Luna Pro78.5
Opus 4.778.3
Gemma 4 31B IT78.3
GPT-5.3 Instant78.3
gpt-oss-120b78.3
Kimi K378.3
Claude Fable 578.1
Opus 4.878.1
Sonnet 578.1
DeepSeek-V4-Pro78.1
Gemini 3.1 Flash-Lite Preview78.1
Gemini 3.1 Pro Preview78.1
Gemini 3.5 Flash78.1
GPT-4.1 Nano78.1
GPT-5.1-Codex78.1
GPT-5.2 Instant78.1
Grok 4.578.1
Haiku 3.577.9
Opus 4.677.9
DeepSeek-R177.9
DeepSeek-V3.2-Exp77.9
Gemma 4 26B A4B IT77.9
GLM 4.677.9
GLM-5.277.9
GPT-477.9
GPT-5.177.9
Qwen3.6 Plus (2026-04-02)77.9
Opus 4.577.7
Loading Atlas data…