Atlas

Benchmarks

← All benchmarks

SWE-Bench Pro (Private Dataset)

Code · 2025-09-19

This private SWE-bench Pro split evaluates repository-level software-engineering tasks withheld from the public set. Scores report the percentage resolved.

Top models (higher is better)

ModelScore
Muse Spark 1.151.5
Opus 4.647.1
Muse Spark44.7
GPT-5.443.4
Gemini 3.1 Pro Preview32.2
GPT-5.2-Codex27.7
GPT-5.223.8
Opus 4.523.4
Gemini 3 Pro Preview17.9
Opus 4.117.8
GPT-514.9
Sonnet 49.1
GPT-4o3.6
Loading Atlas data…