Atlas

Benchmarks

← All benchmarks

GDPval-AA v2

Professional Work · 2026-06-16

Artificial Analysis GDPval-AA v2 evaluation using 220 GDPval gold tasks across 44 occupations. V2 introduced a new sandbox and dependency environment, a three-judge panel, longer agent runs, and an Elo scale rebaselined to a human expert at 1000.

Top models (higher is better)

ModelScore
Claude Fable 51648
Sonnet 51618
DeepSeek-V4-Flash-07311559
Opus 4.81529
Opus 4.71491
GPT-5.41391
MiniMax M31390
GLM-5.21388
Sonnet 4.61376
Muse Spark 1.11375
Gemini 3.5 Flash1349
DeepSeek-V4-Pro1304
Kimi K31271
Qwen3.7-Max1270
JT-4.1 Flash 236B A21B1266
MiMo-V2.5-Pro1264
Motif-3-Beta1259
GLM-5.11256
Nex-N2-Pro1250
Hy31215
Grok Build 0.11214
DeepSeek-V4-Flash1189
Kimi K2.7 Code1188
Kimi K2.61188
Agnes 2.5 Pro Alpha1173
GPT-5.4 Mini1171
GLM-4.71165
Nemotron 3 Ultra 550B A55B1162
MiniMax M2.71158
MiMo-V2.51145
Muse Spark1143
Gemini 3.5 Flash-Lite1140
Qwen3.6 Plus (2026-04-02)1138
Qwen3.6 27B1138
GPT-5.4 Nano1101
Grok 4.31097
GPT-51080
Qwen3.6 35B A3B1053
Sonnet 4.51051
LongCat-2.01027
Loading Atlas data…