GDPval-AA v2.1
Professional Work
Artificial Analysis GDPval-AA v2.1, evaluating 220 professional tasks with shell and web access through Stirrup. Blind pairwise judgments produce Elo ratings anchored to DeepSeek V4.1 Flash (max) at 1600. This version is kept separate from GDPval-AA v2's earlier judging and rating scale.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Opus 5.5 | 1846 |
| Claude Fable 5.1 | 1735 |
| Claude Opus 5 | 1708 |
| Grok 4.7 | 1695 |
| Muse Spark 1.3 | 1674 |
| MiMo-V2.6-Pro | 1673 |
| Qwen3.8 Max (0902) | 1668 |
| GLM-5.3 | 1646 |
| GLM-5.3 Flash | 1641 |
| Grok 4.6 | 1632 |
| Qwen3.8-Flash-Next | 1612 |
| DeepSeek V4.1 Flash | 1600 |
| Qwen3.8 2.4T A95B | 1597 |
| Qwen3.8-Max | 1596 |
| Claude Fable 5 | 1595 |
| GPT-5.6 Sol | 1588 |
| Step 5 Preview | 1566 |
| Agnes 3.0 Flash (hosted) | 1550 |
| GPT-6 Astra | 1542 |
| DeepSeek V4 Flash Vision Exp | 1534 |
| Kimi K3 | 1524 |
| GPT-6 Sol | 1487 |
| Muse Spark 1.2 | 1482 |
| Sonnet 5 | 1449 |
| GPT-5.6 Luna | 1443 |
| DeepSeek V4 Pro 0813 | 1441 |
| Opus 4.8 | 1438 |
| GPT-5.6 Terra | 1432 |
| DeepSeek-V4-Flash-0731 | 1427 |
| Gemini 3.8 Flash | 1412 |
| Qwen3.8 27B | 1409 |
| Gemini 3.7 Flash | 1371 |
| Grok 4.5 | 1370 |
| GPT-6 Luna | 1367 |
| GLM-5.2 | 1358 |
| K2 Horizon 375B A23B | 1349 |
| Opus 4.7 | 1338 |
| GPT-5.5 | 1336 |
| Agnes 2.5 Pro Beta | 1311 |
| Gemini 3.6 Flash | 1265 |