Atlas

Benchmarks

← All benchmarks

APEX-SWE

Code · 2026-01-13

Pass@1 on Mercor's APEX-SWE software engineering benchmark.

Top models (higher is better)

ModelScore
Claude Fable 554.8
Opus 4.847.3
Sonnet 543.6
GPT-5.3-Codex41.5
GPT-5.540.8
Opus 4.640.5
Gemini 3.6 Flash39.7
GPT-5.6 Sol39.7
Opus 4.538.7
GLM-5.237.3
GPT-5.436.5
Gemini 3.5 Flash32.5
Kimi K2.7 Code32.5
Sonnet 4.531.0
GPT-5.2-Codex30.8
Kimi K2.530.3
GPT-5.1-Codex29.0
Gemini 3.1 Pro Preview28.8
Gemini 3 Pro Preview26.8
Grok 421.0
DeepSeek-V3.215.8
Kimi K2 Thinking11.2
Loading Atlas data…