Atlas

Benchmarks

← All benchmarks

GDPval-AA v1

Professional Work · 2025-12-10

Artificial Analysis GDPval-AA v1 evaluation using 220 GDPval gold tasks across 44 occupations; Elo from blind pairwise comparisons before the June 2026 v2 protocol and Elo rebaseline.

Top models (higher is better)

ModelScore
Opus 4.81890
GPT-5.51769
Opus 4.71753
Gemini 3.5 Flash1656
Sonnet 4.61633
Opus 4.61606
GPT-5.21462
Gemini 3.1 Pro Preview1317
Gemini 3 Flash Preview1204
Gemini 3 Pro Preview1195
Loading Atlas data…