GDPval-AA v2
Professional Work · 2026-06-16
Artificial Analysis GDPval-AA v2 evaluation using 220 GDPval gold tasks across 44 occupations. V2 introduced a new sandbox and dependency environment, a three-judge panel, longer agent runs, and an Elo scale rebaselined to a human expert at 1000.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 1648 |
| Sonnet 5 | 1618 |
| DeepSeek-V4-Flash-0731 | 1559 |
| Opus 4.8 | 1529 |
| Opus 4.7 | 1491 |
| GPT-5.4 | 1391 |
| MiniMax M3 | 1390 |
| GLM-5.2 | 1388 |
| Sonnet 4.6 | 1376 |
| Muse Spark 1.1 | 1375 |
| Gemini 3.5 Flash | 1349 |
| DeepSeek-V4-Pro | 1304 |
| Kimi K3 | 1271 |
| Qwen3.7-Max | 1270 |
| JT-4.1 Flash 236B A21B | 1266 |
| MiMo-V2.5-Pro | 1264 |
| Motif-3-Beta | 1259 |
| GLM-5.1 | 1256 |
| Nex-N2-Pro | 1250 |
| Hy3 | 1215 |
| Grok Build 0.1 | 1214 |
| DeepSeek-V4-Flash | 1189 |
| Kimi K2.7 Code | 1188 |
| Kimi K2.6 | 1188 |
| Agnes 2.5 Pro Alpha | 1173 |
| GPT-5.4 Mini | 1171 |
| GLM-4.7 | 1165 |
| Nemotron 3 Ultra 550B A55B | 1162 |
| MiniMax M2.7 | 1158 |
| MiMo-V2.5 | 1145 |
| Muse Spark | 1143 |
| Gemini 3.5 Flash-Lite | 1140 |
| Qwen3.6 Plus (2026-04-02) | 1138 |
| Qwen3.6 27B | 1138 |
| GPT-5.4 Nano | 1101 |
| Grok 4.3 | 1097 |
| GPT-5 | 1080 |
| Qwen3.6 35B A3B | 1053 |
| Sonnet 4.5 | 1051 |
| LongCat-2.0 | 1027 |