AutomationBench 1.0.6 (Zapier)
Agents
Zapier's official AutomationBench 1.0.6 leaderboard: strict end-state task completion across 657 held-out business workflows, API tools and a 50-step limit. Distinct from the Artificial Analysis partial-objective scoring series and earlier unversioned Zapier snapshots.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-6 Astra | 41.4 |
| Claude Opus 5.5 | 40.0 |
| GPT-6 Sol | 33.2 |
| Gemini 3.7 Flash | 30.4 |
| Gemini 3.8 Flash | 29.7 |
| GPT-5.6 Sol | 28.8 |
| Claude Opus 5 | 26.9 |
| GPT-5.6 Terra | 23.6 |
| Kimi K3 | 22.7 |
| Claude Fable 5.1 | 22.4 |
| GPT-6 Luna | 20.7 |
| GPT-5.6 Luna | 17.1 |
| Gemini 3.6 Flash | 17.1 |
| Claude Fable 5 | 17.1 |
| Opus 4.8 | 16.9 |
| GPT-5.5 | 16.6 |
| Gemini 3.5 Flash | 13.4 |
| Opus 4.7 | 13.4 |
| GPT-5.4 | 11.6 |
| Sonnet 5 | 10.7 |
| Gemini 3.1 Pro Preview | 8.7 |
| GLM-5.2 | 7.8 |
| GLM-5.1 | 6.2 |
| Sonnet 4.6 | 5.3 |
| MiniMax M3 | 4.9 |
| Qwen3.6 Plus (2026-04-02) | 4.3 |
| Gemini 3.5 Flash-Lite | 4.0 |
| Qwen3.7-Plus | 3.7 |
| Kimi K2.7 Code | 3.2 |
| Kimi K2.6 | 2.6 |
| Gemma 4 31B IT | 1.7 |
| Haiku 4.5 | 0.5 |
| MiniMax M2.7 | 0.5 |
| gpt-oss-120b | 0.1 |