Atlas

Benchmarks

← All benchmarks

GDP-PDF

Professional Work · 2026-04-14

GDP-PDF (Surge AI) evaluates whether models can answer questions about real-world professional PDFs from economically valuable knowledge-work domains; scored as answer accuracy. Distinct from OpenAI's GDPval win-rate benchmark despite the similar name.

Top models (higher is better)

ModelScore
GPT-5.6 Sol30.7
Claude Fable 529.8
GPT-5.526.0
GPT-5.6 Terra24.7
Claude Opus 524.0
GPT-5.6 Luna22.7
Opus 4.822.5
Opus 4.721.0
Kimi K319.0
Sonnet 4.618.0
Muse Spark 1.115.0
Gemini 3.5 Flash14.0
Gemini 3.6 Flash14.0
Grok 4.514.0
Kimi K2.612.0
Gemini 3.5 Flash-Lite10.0
Gemini 3 Flash Preview10.0
Grok 4.38.0
Mistral Large 3 675B Instruct 25122.0
Nemotron 3 Nano Omni 30B A3B2.0
Nova 2 Pro (Preview)2.0
Loading Atlas data…