Atlas

Benchmarks

← All benchmarks

Ruby LLM Program Fixer — School Library

Code · 2025-08-01

The School Library Program Fixer task asks a model to repair a broken Ruby school-library implementation against 28 tests. Its composite is 90% test success plus 10% RuboCop quality, with each offense subtracting two quality points down to zero.

Top models (higher is better)

ModelScore
Claude Opus 583.5
GPT-5.581.1
Claude Fable 580.1
Opus 4.780.1
DeepSeek-V3.2-Speciale80.1
Claude 3 Haiku79.9
DeepSeek-V4-Pro79.7
GLM-579.7
GPT-5.6 Luna79.7
GPT-5.6 Terra79.7
Kimi K379.7
Grok 479.5
Kimi K2.679.5
GPT-5.6 Luna Pro79.1
GPT-5.6 Terra Pro79.1
Sonnet 4.678.9
DeepSeek-V4-Flash78.5
Horizon Beta78.1
Opus 4.676.9
GPT-5.2 Instant76.7
Opus 4.876.5
GLM-5.176.5
Gemma 4 31B IT76.3
GLM-5.276.3
GPT-5.1 Instant76.3
GPT-5.3 Instant76.3
Qwen3.6 Plus (2026-04-02)76.3
Sonnet 4.576.1
DeepSeek-R176.1
gpt-oss-120b76.1
O4 Mini76.1
o1-mini75.9
Grok 3 Mini75.7
o3-mini75.5
ChatGPT-4o Latest (source-unspecified snapshot)75.3
GLM-4.774.7
GPT-574.5
GPT-4.174.3
Gemma 4 26B A4B IT73.9
Qwen3.6 35B A3B73.5
Loading Atlas data…