Atlas

Benchmarks

← All benchmarks

APEX-Agents

Professional Work · 2026-01-20

A benchmark for assessing whether AI agents can execute long-horizon, cross-application professional-services tasks created by investment banking analysts, management consultants, and corporate lawyers.

Top models (higher is better)

ModelScore
Claude Fable 543.3
Muse Spark 1.141.9
GPT-5.6 Sol Pro40.0
GPT-5.6 Sol39.9
Opus 4.839.4
GPT-5.538.5
GLM-5.235.6
GPT-5.434.9
Opus 4.733.7
Gemini 3.1 Pro Preview33.5
Sonnet 532.5
Opus 4.632.4
GPT-5.232.4
Gemini 3 Pro Preview31.5
GPT-5.3-Codex29.9
GPT-5.2-Codex27.2
Opus 4.520.7
GLM-4.78.7
Loading Atlas data…