Atlas

Benchmarks

← All benchmarks

APEX-Agents 1.1

Professional Work · 2026-09-08

Mercor APEX-Agents 1.1: 240 tasks across corporate law, management consulting and investment banking, with revised worlds, clearer prompts and a reworked rubric judge. Mean Score is the average fraction of criteria passed. Uses the Loop truncated-tools agent and remains separate from the original 480-task APEX-Agents release.

Top models (higher is better)

ModelScore
Claude Opus 5.581.3
Gemini 3.7 Flash79.4
Grok 4.677.3
Claude Fable 5.177.1
Claude Opus 577.0
GPT-6 Astra75.1
Gemini 3.8 Flash74.6
Claude Fable 574.5
GPT-5.6 Terra71.8
Grok 4.570.5
GPT-5.570.3
Muse Spark 1.369.9
GPT-6 Sol68.7
Grok 4.768.7
GPT-5.468.2
Sonnet 567.4
GLM-5.3 Flash66.8
GLM-5.366.2
GPT-5.6 Sol Pro65.2
Opus 4.864.4
Kimi K364.0
Gemini 3.6 Flash63.4
Opus 4.763.1
DeepSeek V4 Pro 081362.3
Opus 4.661.8
GLM-5.261.1
GPT-6 Luna59.0
GPT-5.6 Luna57.8
Sonnet 4.657.6
GLM-5.156.8
MiniMax M353.5
Kimi K2.7 Code53.4
Gemini 3.1 Pro Preview52.5
Muse Spark 1.251.7
DeepSeek V4.1 Flash50.4
Inkling48.8
Muse Spark 1.146.2
Gemini 3.5 Flash-Lite46.1
Gemini 3.5 Flash44.3
Qwen3.5 397B A17B40.3
Loading Atlas data…