Atlas

Benchmarks

← All benchmarks

APEX-Agents 1.1 Pass@1

Professional Work · 2026-09-08

Strict single-attempt success on APEX-Agents 1.1's 240-task cohort: a task succeeds only when every rubric criterion passes. The published estimate averages repeated attempts.

Top models (higher is better)

ModelScore
Claude Opus 5.573.5
Claude Fable 5.168.6
Gemini 3.7 Flash67.8
Claude Opus 565.8
Grok 4.665.3
GPT-6 Astra64.7
Gemini 3.8 Flash64.3
Claude Fable 563.6
GPT-5.6 Terra58.2
Muse Spark 1.357.8
GLM-5.356.6
Grok 4.556.2
GPT-5.555.1
Grok 4.754.6
Sonnet 554.5
GPT-6 Sol54.3
GLM-5.3 Flash52.8
GPT-5.452.4
GPT-5.6 Sol Pro51.4
Kimi K350.6
Opus 4.749.2
Opus 4.848.9
DeepSeek V4 Pro 081347.3
Gemini 3.6 Flash46.9
Opus 4.646.3
GLM-5.245.2
GPT-6 Luna44.3
Sonnet 4.643.0
GPT-5.6 Luna43.0
GLM-5.140.9
DeepSeek V4.1 Flash39.5
MiniMax M337.7
Kimi K2.7 Code37.6
Muse Spark 1.236.4
Gemini 3.1 Pro Preview35.3
Inkling33.8
Muse Spark 1.130.3
Gemini 3.5 Flash-Lite29.3
Gemini 3.5 Flash27.5
Qwen3.5 397B A17B24.9
Loading Atlas data…