Atlas

Benchmarks

← All benchmarks

GDPval-AA v2

Professional Work · 2026-02-17

Artificial Analysis evaluation using 220 GDPval gold tasks across 44 occupations; Elo from blind pairwise comparisons in the Stirrup environment.

Top models (higher is better)

ModelScore
Opus 4.81890
GPT-5.51769
Opus 4.71753
Claude Fable 51648
Sonnet 4.61633
Sonnet 51618
Opus 4.61606
DeepSeek-V4-Flash-07311559
GPT-5.21462
GPT-5.41391
MiniMax M31390
GLM-5.21388
Muse Spark 1.11375
Gemini 3.1 Pro Preview1317
DeepSeek-V4-Pro1304
Kimi K31271
Qwen3.7-Max1270
JT-4.1 Flash 236B A21B1266
MiMo-V2.5-Pro1264
Motif-3-Beta1259
GLM-5.11256
Nex-N2-Pro1250
Hy31215
Grok Build 0.11214
Gemini 3 Flash Preview1204
Gemini 3 Pro Preview1195
DeepSeek-V4-Flash1189
Kimi K2.7 Code1188
Kimi K2.61188
Agnes 2.5 Pro Alpha1173
GPT-5.4 Mini1171
GLM-4.71165
Nemotron 3 Ultra 550B A55B1162
MiniMax M2.71158
MiMo-V2.51145
Muse Spark1143
Gemini 3.5 Flash-Lite1140
Qwen3.6 Plus (2026-04-02)1138
Qwen3.6 27B1138
GPT-5.4 Nano1101
Loading Atlas data…