CursorBench
Code · 2026-03-11
Cursor's production-harness agentic coding benchmark at max effort.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 72.9 |
| Claude Opus 5 | 70.0 |
| GPT-5.6 Sol | 67.2 |
| Opus 4.7 | 64.8 |
| GPT-5.5 | 64.3 |
| Opus 4.8 | 63.8 |
| Sonnet 5 | 61.2 |
| GLM-5.2 | 54.6 |
| Sonnet 4.6 | 49.0 |
| Kimi K2.6 | 47.6 |
| Kimi K2.5 | 31.9 |