GDPval-AA v2
Professional Work · 2026-02-17
Artificial Analysis evaluation using 220 GDPval gold tasks across 44 occupations; Elo from blind pairwise comparisons in the Stirrup environment.
Top models (higher is better)
| Model | Score |
|---|---|
| Opus 4.8 | 1890 |
| GPT-5.5 | 1769 |
| Opus 4.7 | 1753 |
| Claude Fable 5 | 1648 |
| Sonnet 4.6 | 1633 |
| Sonnet 5 | 1618 |
| Opus 4.6 | 1606 |
| DeepSeek-V4-Flash-0731 | 1559 |
| GPT-5.2 | 1462 |
| GPT-5.4 | 1391 |
| MiniMax M3 | 1390 |
| GLM-5.2 | 1388 |
| Muse Spark 1.1 | 1375 |
| Gemini 3.1 Pro Preview | 1317 |
| DeepSeek-V4-Pro | 1304 |
| Kimi K3 | 1271 |
| Qwen3.7-Max | 1270 |
| JT-4.1 Flash 236B A21B | 1266 |
| MiMo-V2.5-Pro | 1264 |
| Motif-3-Beta | 1259 |
| GLM-5.1 | 1256 |
| Nex-N2-Pro | 1250 |
| Hy3 | 1215 |
| Grok Build 0.1 | 1214 |
| Gemini 3 Flash Preview | 1204 |
| Gemini 3 Pro Preview | 1195 |
| DeepSeek-V4-Flash | 1189 |
| Kimi K2.7 Code | 1188 |
| Kimi K2.6 | 1188 |
| Agnes 2.5 Pro Alpha | 1173 |
| GPT-5.4 Mini | 1171 |
| GLM-4.7 | 1165 |
| Nemotron 3 Ultra 550B A55B | 1162 |
| MiniMax M2.7 | 1158 |
| MiMo-V2.5 | 1145 |
| Muse Spark | 1143 |
| Gemini 3.5 Flash-Lite | 1140 |
| Qwen3.6 Plus (2026-04-02) | 1138 |
| Qwen3.6 27B | 1138 |
| GPT-5.4 Nano | 1101 |