Atlas

Benchmarks

← All benchmarks

Artificial Analysis Agentic Index

Indexes · 2025-09-02

Composite index of tool use, planning, autonomy, and agentic workflows.

Top models (higher is better)

ModelScore
Claude Opus 555.3
GPT-5.6 Sol54.0
Claude Fable 552.8
Kimi K350.1
GPT-5.6 Terra47.4
Opus 4.847.2
Sonnet 546.7
Grok 4.545.7
DeepSeek-V4-Flash-073145.7
GPT-5.6 Luna45.6
GPT-5.544.9
Opus 4.744.4
GLM-5.243.1
GPT-5.441.1
Sonnet 4.640.8
Gemini 3.6 Flash38.7
Muse Spark 1.137.5
Gemini 3.5 Flash37.4
DeepSeek-V4-Pro36.4
MiniMax M335.4
Motif-3-Beta34.9
JT-4.1 Flash 236B A21B34.9
Inkling32.3
DeepSeek-V4-Flash31.1
Nex-N2-Pro31.0
Inkling-Small30.8
Hy330.7
Qwen3.7-Max30.6
Kimi K2.630.3
GPT-5.4 Mini30.2
GLM-5.129.9
Kimi K2.7 Code29.6
MiMo-V2.5-Pro29.1
Muse Spark28.7
Grok Build 0.128.0
Qwen3.6 Plus (2026-04-02)27.6
GPT-5.4 Nano27.5
Nemotron 3 Ultra 550B A55B27.4
Qwen3.6 27B27.0
Gemini 3.5 Flash-Lite26.8
Loading Atlas data…