Atlas

Benchmarks

← All benchmarks

AutomationBench 1.0.6 (Zapier)

Agents

Zapier's official AutomationBench 1.0.6 leaderboard: strict end-state task completion across 657 held-out business workflows, API tools and a 50-step limit. Distinct from the Artificial Analysis partial-objective scoring series and earlier unversioned Zapier snapshots.

Top models (higher is better)

ModelScore
GPT-6 Astra41.4
Claude Opus 5.540.0
GPT-6 Sol33.2
Gemini 3.7 Flash30.4
Gemini 3.8 Flash29.7
GPT-5.6 Sol28.8
Claude Opus 526.9
GPT-5.6 Terra23.6
Kimi K322.7
Claude Fable 5.122.4
GPT-6 Luna20.7
GPT-5.6 Luna17.1
Gemini 3.6 Flash17.1
Claude Fable 517.1
Opus 4.816.9
GPT-5.516.6
Gemini 3.5 Flash13.4
Opus 4.713.4
GPT-5.411.6
Sonnet 510.7
Gemini 3.1 Pro Preview8.7
GLM-5.27.8
GLM-5.16.2
Sonnet 4.65.3
MiniMax M34.9
Qwen3.6 Plus (2026-04-02)4.3
Gemini 3.5 Flash-Lite4.0
Qwen3.7-Plus3.7
Kimi K2.7 Code3.2
Kimi K2.62.6
Gemma 4 31B IT1.7
Haiku 4.50.5
MiniMax M2.70.5
gpt-oss-120b0.1
Loading Atlas data…