Atlas

Benchmarks

← All benchmarks

APEX-Agents

Professional Work · 2026-01-20

A benchmark for assessing whether AI agents can execute long-horizon, cross-application professional-services tasks created by investment banking analysts, management consultants, and corporate lawyers.

Top models (higher is better)

ModelScore
Claude Fable 545.0
Claude Opus 543.5
Opus 4.842.5
Muse Spark 1.141.9
GPT-5.6 Sol Pro40.0
GPT-5.6 Sol39.9
Kimi K339.3
GPT-5.538.5
GPT-5.436.0
GLM-5.235.6
Grok 4.534.2
Opus 4.733.9
Gemini 3.1 Pro Preview33.5
Sonnet 532.5
Opus 4.632.4
GPT-5.232.4
GPT-5.3-Codex31.8
Gemini 3 Pro Preview31.5
GPT-5.2-Codex27.6
Kimi K2.7 Code27.6
GPT-5.4 Mini24.6
Gemini 3 Flash Preview24.0
Sonnet 4.623.7
Opus 4.520.7
GPT-5.1-Codex20.7
GPT-5-Codex20.1
Kimi K2.618.9
GPT-518.3
GPT-5.117.5
GLM-517.2
o317.2
GPT-5.4 Nano16.9
Grok 415.2
Kimi K2.514.4
Qwen3.5 Plus (2026-02-15)13.6
Grok 4.112.8
Sonnet 49.3
Haiku 4.58.9
GLM-4.78.7
DeepSeek-V3.27.0
Loading Atlas data…