Atlas

Benchmarks

← All benchmarks

SWE-bench Verified - <15 Min Fix

Code · 2024-08-13

The <15 min fix split of SWE-bench Verified. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 598.5
GPT-5.6 Sol97.4
GPT-5.6 Luna96.4
Claude Fable 595.9
Grok 4.593.8
Opus 4.892.8
Kimi K392.3
GPT-5.591.8
Opus 4.690.2
Opus 4.790.2
GPT-5.3-Codex90.2
GPT-5.289.2
Gemini 3.1 Pro Preview88.7
GLM-5.188.7
Kimi K2.7 Code88.7
Gemini 3 Pro Preview88.1
GLM-5.288.1
GPT-5.2-Codex88.1
GPT-5.488.1
Muse Spark 1.188.1
Opus 4.587.6
DeepSeek-V4-Pro87.6
Gemini 3 Flash Preview87.6
Kimi K2.687.6
Sonnet 4.687.1
Gemini 3.6 Flash87.1
Grok 4.2087.1
MiniMax M2.587.1
Composer 2.586.6
Gemini 3.5 Flash86.6
Inkling86.1
MiniMax M2.786.1
Gemini 3.5 Flash-Lite85.6
GPT-5.4 Mini85.6
MiniMax M2.185.6
Qwen3.6-Max-Preview85.6
Qwen3.6 Plus (2026-04-02)85.6
Muse Spark85.1
Kimi K2.584.5
MiniMax M384.5
Loading Atlas data…