APEX-SWE
Code · 2026-01-13
Pass@1 on Mercor's APEX-SWE software engineering benchmark.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 54.8 |
| Opus 4.8 | 47.3 |
| Sonnet 5 | 43.6 |
| GPT-5.3-Codex | 41.5 |
| GPT-5.5 | 40.8 |
| Opus 4.6 | 40.5 |
| Gemini 3.6 Flash | 39.7 |
| GPT-5.6 Sol | 39.7 |
| Opus 4.5 | 38.7 |
| GLM-5.2 | 37.3 |
| GPT-5.4 | 36.5 |
| Gemini 3.5 Flash | 32.5 |
| Kimi K2.7 Code | 32.5 |
| Sonnet 4.5 | 31.0 |
| GPT-5.2-Codex | 30.8 |
| Kimi K2.5 | 30.3 |
| GPT-5.1-Codex | 29.0 |
| Gemini 3.1 Pro Preview | 28.8 |
| Gemini 3 Pro Preview | 26.8 |
| Grok 4 | 21.0 |
| DeepSeek-V3.2 | 15.8 |
| Kimi K2 Thinking | 11.2 |