Atlas

Benchmarks

← All benchmarks

DeepSWE v1.1 pass@4

Code · 2026-06-14

DeepSWE v1.1 pass@4 is the percentage of attempted tasks with at least one passing scored rollout among four nominal runs. Tasks with only excluded provider, verifier, or network errors do not enter the denominator.

Top models (higher is better)

ModelScore
GPT-5.590.3
GPT-5.6 Luna90.3
Claude Opus 589.4
Kimi K389.4
Claude Fable 588.5
GPT-5.6 Terra88.5
GPT-5.6 Sol86.7
Opus 4.880.5
Sonnet 579.6
Muse Spark 1.179.6
GPT-5.477.9
Grok 4.577.9
GLM-5.277.0
Gemini 3.6 Flash76.1
Gemini 3.5 Flash66.4
Kimi K2.7 Code61.1
Sonnet 4.656.6
Gemini 3.1 Pro Preview28.3
Loading Atlas data…