Atlas

Benchmarks

← All benchmarks

APEX-v1-extended

Professional Work · 2025-12-10

Mercor APEX-v1-extended is a held-out professional-work benchmark that extends APEX with expert-evaluated tasks. Scores report percentage task performance.

Top models (higher is better)

ModelScore
GPT-5.467.2
Opus 4.665.7
GPT-5.2-Codex65.3
Gemini 3.1 Pro Preview65.1
GPT-5.264.7
GPT-5.3-Codex64.6
GPT-564.5
GPT-5-Codex62.8
GPT-5.1-Codex61.9
Gemini 3 Flash Preview60.9
Gemini 3 Pro Preview60.9
o360.5
Grok 4.1 Fast57.5
Opus 4.557.3
Grok 457.1
Sonnet 4.654.4
GLM-4.751.7
GLM-549.0
Loading Atlas data…