Atlas

Benchmarks

← All benchmarks

SWE Atlas - Codebase QnA

Code · 2026-03-04

Score on SWE Atlas codebase QnA tasks that require runtime analysis and multi-file reasoning.

Top models (higher is better)

ModelScore
Opus 4.857.3
GLM-5.248.1
Laguna S 2.146.2
GPT-5.6 Sol46.0
GPT-5.545.4
Muse Spark 1.142.2
GPT-5.440.8
Opus 4.740.3
Claude Fable 539.0
Opus 4.633.3
GPT-5.3-Codex32.6
Sonnet 4.631.2
DeepSeek-V4-Pro27.2
Muse Spark24.2
GLM-520.5
Gemini 3.1 Pro Preview13.5
Kimi K2.513.1
MiniMax M2.510.3
Gemini 3 Flash Preview8.2
Loading Atlas data…