Atlas

Benchmarks

← All benchmarks

SWE-bench Multilingual

Code · 2025-05-06

SWE-bench Multilingual evaluates software-engineering agents on 300 curated issue-resolution tasks drawn from 42 repositories across nine programming languages. Agents modify a repository snapshot to resolve a real GitHub issue, and success requires both issue-specific and regression tests to pass.

Top models (higher is better)

ModelScore
Claude Mythos 592.2
Claude Opus 589.5
Claude Mythos Preview87.3
Claude Fable 586.6
Opus 4.884.4
Opus 4.780.5
Laguna S 2.178.5
Sonnet 578.3
Qwen3.7-Max78.3
Opus 4.677.8
Opus 4.576.2
DeepSeek-V4-Pro76.2
Sonnet 4.675.9
Hy375.8
Gemini 3 Flash Preview72.7
GLM-569.7
Gemini 3 Pro Preview68.7
MiniMax M2.568.3
Nemotron 3 Ultra 550B A55B67.7
Kimi K2.567.3
Sonnet 4.567.0
GPT-5.2 (2025-12-11)66.7
GPT-5.2-Codex66.3
Haiku 4.564.7
DeepSeek-V3.259.0
GPT-5 Mini (2025-08-07)39.7
Loading Atlas data…