Atlas

Benchmarks

← All benchmarks

CursorBench

Code · 2026-03-11

Cursor's production-harness agentic coding benchmark at max effort.

Top models (higher is better)

ModelScore
Claude Fable 572.9
Claude Opus 570.0
GPT-5.6 Sol67.2
Opus 4.764.8
GPT-5.564.3
Opus 4.863.8
Sonnet 561.2
GLM-5.254.6
Sonnet 4.649.0
Kimi K2.647.6
Kimi K2.531.9
Loading Atlas data…