Atlas

Benchmarks

← All benchmarks

Ruby LLM Program Fixer — Calendar

Code · 2025-08-01

The Calendar Program Fixer task asks a model to repair a broken Ruby calendar implementation against 23 tests. Its composite is 90% test success plus 10% RuboCop quality, with each offense subtracting two quality points down to zero.

Top models (higher is better)

ModelScore
gpt-oss-120b92.1
Gemma 4 26B A4B IT91.9
Grok 4.591.7
Opus 491.3
Haiku 4.590.9
Opus 4.190.9
Gemini 2.0 Flash 00188.6
GPT-4 Turbo87.0
GPT-5.1-Codex mini86.7
Kimi K2.686.1
Claude Opus 585.9
GPT-4.185.6
Sonnet 4.685.3
Codestral 25.0885.3
Claude Fable 585.1
Opus 4.885.1
Gemini 3.5 Flash85.1
Gemini 2.5 Flash84.9
GLM-584.9
Opus 4.684.7
Opus 4.784.7
Grok 484.7
Haiku 3.584.5
Opus 4.584.5
Gemini 2.5 Pro84.5
GPT-4.1 Nano84.5
O4 Mini84.5
DeepSeek-V4-Pro84.3
Gemini 3.1 Flash-Lite Preview84.3
Kimi K2 Thinking84.3
GLM-5.183.9
Llama 4 Maverick83.9
o1-mini83.7
GPT-5.3-Codex83.2
GPT-5.483.2
GPT-5.6 Sol83.2
GPT-5.6 Sol Pro83.2
GPT-5.6 Terra83.2
GPT-5.6 Terra Pro83.2
GPT-5.583.0
Loading Atlas data…