Atlas

Benchmarks

← All benchmarks

SWE-Bench Pro (Public Dataset)

Code · 2025-09-19

Percent of challenging long-horizon software engineering tasks resolved in public repositories.

Top models (higher is better)

ModelScore
Claude Fable 580.3
Claude Mythos 580.3
Claude Opus 579.2
Claude Mythos Preview77.8
Opus 4.869.2
GPT-5.6 Sol64.6
Opus 4.764.3
Sonnet 563.2
GPT-5.6 Luna62.7
Muse Spark 1.161.5
Qwen3.7-Max60.6
Laguna S 2.159.4
Gemini 3.6 Flash58.7
GPT-5.558.6
Hy357.9
GPT-5.457.7
Opus 4.656.7
GPT-5.2-Codex56.4
MiniMax M2.756.2
MiMo-V2.556.1
GPT-5.3-Codex56.0
Inkling-Small55.9
GPT-5.255.6
DeepSeek-V4-Pro55.4
Muse Spark55.0
GPT-5.4 Mini54.4
Inkling54.3
Gemini 3.1 Pro Preview54.2
Gemini 3.5 Flash-Lite54.2
Sonnet 4.653.8
Inkling-Small Preview53.2
DeepSeek-V4-Flash52.6
GPT-5.4 Nano52.4
Opus 4.552.0
GLM-5.251.8
GPT-5.3-Codex-Spark51.5
GPT-5.6 Terra51.3
Qwen3.5 397B A17B50.9
Kimi K2.650.1
GLM-5.149.2
Loading Atlas data…