Atlas

Benchmarks

← All benchmarks

APEX-Accounting Pass@1

Professional Work · 2026-07-31

Strict task success on APEX-Accounting's 160 month-end-close tasks: every criterion must pass in one attempt. Kept separate from the partial-credit Mean Score.

Top models (higher is better)

ModelScore
Claude Opus 5.514.8
GPT-6 Astra11.9
Claude Fable 5.111.7
Muse Spark 1.310.8
Claude Opus 510.5
Claude Fable 59.8
GPT-5.6 Sol Pro9.6
GLM-5.39.2
Muse Spark 1.28.9
Gemini 3.8 Flash8.7
GPT-5.6 Sol8.4
DeepSeek V4.1 Flash7.8
Muse Spark 1.17.7
GPT-5.56.2
Kimi K36.2
GPT-5.6 Terra6.0
GPT-5.45.3
Grok 4.54.5
Opus 4.64.4
GLM-5.24.4
GPT-5.6 Luna4.4
Opus 4.84.2
Grok 4.74.2
Gemini 3.1 Pro Preview3.1
Kimi K2.7 Code2.9
MiniMax M32.2
GLM-5.3 Flash1.7
GLM-5.11.2
DeepSeek-V3.21.1
Inkling0.8
Nemotron 3 Ultra 550B A55B (NVFP4)0.3
gpt-oss-120b0.0
Qwen3.5 397B A17B0.0
Loading Atlas data…