Atlas

Benchmarks

← All benchmarks

MCP Atlas Public

Agents · 2025-09-19

Real-world tool-use benchmark across 36 MCP servers and 220 tools.

Top models (higher is better)

ModelScore
Muse Spark 1.188.1
Claude Opus 585.8
Claude Fable 584.7
Gemini 3.5 Flash83.6
GPT-5.6 Sol83.6
GLM-5.282.6
Muse Spark82.2
Opus 4.882.2
Gemini 3.5 Flash-Lite79.8
Opus 4.779.1
Gemini 3.1 Pro Preview78.2
GPT-5.6 Luna77.0
GLM-5.175.6
GPT-5.575.3
Qwen3.5 397B A17B74.2
Opus 4.569.8
Sonnet 4.669.5
DeepSeek-V4-Flash69.0
Kimi K2.564.4
Opus 4.662.7
Sonnet 4.559.5
GLM-4.758.1
Gemini 3.1 Flash-Lite Preview57.1
GPT-5.4 Nano56.1
Gemini 3 Pro Preview54.1
GPT-5.150.1
MiniMax M2.749.4
GPT-5 Mini47.6
Nemotron 3 Ultra 550B A55B47.4
o3-pro44.5
Haiku 4.540.2
Gemini 2.5 Pro8.8
Gemini 2.5 Flash3.4
Loading Atlas data…