Atlas

Benchmarks

← All benchmarks

GDP.pdf (Artificial Analysis, Mean Criteria)

Professional Work

Task-macro mean atomic-criterion pass rate for Artificial Analysis' five-attempt GDP.pdf implementation, with GPT-5.6 Luna Medium judging across 100 tasks. Distinct from the stricter all-pass metric.

Top models (higher is better)

ModelScore
Claude Opus 5.582.3
GPT-6 Astra82.0
Claude Fable 5.180.2
Muse Spark 1.378.1
GPT-5.6 Sol77.6
GPT-6 Sol77.5
Claude Fable 577.2
Qwen3.8 Max (0902)76.0
GPT-5.6 Terra75.9
Gemini 3.8 Flash75.9
Claude Opus 575.9
Kimi K375.7
GPT-5.6 Luna75.5
Muse Spark 1.275.3
Gemini 3.7 Flash75.2
GPT-5.575.0
Opus 4.874.9
Qwen3.8-Max74.6
Muse Spark 1.174.2
GLM-5.3 Flash71.5
Grok 4.771.2
Grok 4.671.1
Gemini 3.6 Flash70.8
GPT-5.5 Instant (2026-06-25 hosted snapshot)70.5
Gemini 3.5 Flash70.4
Grok 4.570.3
GPT-6 Luna69.8
Sonnet 4.668.9
Gemini 3.1 Pro Preview68.7
MiMo-V2.6-Pro68.1
DeepSeek V4.1 Flash67.5
Step 5 Preview67.2
Qwen3.8 27B67.1
Sonnet 566.6
Kimi K2.7 Code66.3
Qwen3.8-Flash-Next65.4
Qwen3.8 2.4T A95B64.6
Inkling64.5
Muse Glimmer 30B64.3
Gemini 3.5 Flash-Lite64.0
Loading Atlas data…