APEX-Agents
Professional Work · 2026-01-20
A benchmark for assessing whether AI agents can execute long-horizon, cross-application professional-services tasks created by investment banking analysts, management consultants, and corporate lawyers.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 45.0 |
| Claude Opus 5 | 43.5 |
| Opus 4.8 | 42.5 |
| Muse Spark 1.1 | 41.9 |
| GPT-5.6 Sol Pro | 40.0 |
| GPT-5.6 Sol | 39.9 |
| Kimi K3 | 39.3 |
| GPT-5.5 | 38.5 |
| GPT-5.4 | 36.0 |
| GLM-5.2 | 35.6 |
| Grok 4.5 | 34.2 |
| Opus 4.7 | 33.9 |
| Gemini 3.1 Pro Preview | 33.5 |
| Sonnet 5 | 32.5 |
| Opus 4.6 | 32.4 |
| GPT-5.2 | 32.4 |
| GPT-5.3-Codex | 31.8 |
| Gemini 3 Pro Preview | 31.5 |
| GPT-5.2-Codex | 27.6 |
| Kimi K2.7 Code | 27.6 |
| GPT-5.4 Mini | 24.6 |
| Gemini 3 Flash Preview | 24.0 |
| Sonnet 4.6 | 23.7 |
| Opus 4.5 | 20.7 |
| GPT-5.1-Codex | 20.7 |
| GPT-5-Codex | 20.1 |
| Kimi K2.6 | 18.9 |
| GPT-5 | 18.3 |
| GPT-5.1 | 17.5 |
| GLM-5 | 17.2 |
| o3 | 17.2 |
| GPT-5.4 Nano | 16.9 |
| Grok 4 | 15.2 |
| Kimi K2.5 | 14.4 |
| Qwen3.5 Plus (2026-02-15) | 13.6 |
| Grok 4.1 | 12.8 |
| Sonnet 4 | 9.3 |
| Haiku 4.5 | 8.9 |
| GLM-4.7 | 8.7 |
| DeepSeek-V3.2 | 7.0 |