Atlas

Benchmarks

← All benchmarks

GPQA Diamond (Artificial Analysis avg@5)

General QA · 2023-11-20

Artificial Analysis' zero-shot GPQA Diamond protocol averages pass@1 over five independent attempts for each of 198 questions (990 scored attempts). This repeated-run aggregate is separated from single-attempt GPQA observations so it does not receive a binomial 198-item noise model.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview94.1
GPT-5.6 Sol94.1
Claude Opus 593.7
GPT-5.593.5
Kimi K393.5
Grok 4.593.1
MiniMax M392.9
Gemini 3.6 Flash92.8
Claude Fable 592.6
GPT-5.6 Terra92.5
Qwen3.7-Max92.3
Gemini 3.5 Flash92.2
Opus 4.892.0
GPT-5.492.0
GPT-5.3-Codex91.5
Opus 4.791.4
Sonnet 591.1
GPT-5.6 Luna91.1
Grok 4.2091.1
Kimi K2.691.1
DeepSeek-V4-Flash-073190.8
Gemini 3 Pro Preview90.8
DeepSeek-V4-Pro90.5
GPT-5.290.3
Grok 4.390.1
Qwen3.7-Plus90.0
GPT-5.2-Codex89.9
Gemini 3 Flash Preview89.8
Muse Spark 1.189.8
Hy389.7
Opus 4.689.6
Kimi K2.7 Code89.6
GLM-5.289.5
Grok Build 0.189.5
Inkling-Small89.5
DeepSeek-V4-Flash89.4
Qwen3.5 397B A17B89.3
Nex-N2-Pro89.2
Qwen3.6-Max-Preview88.8
Muse Spark88.4
Loading Atlas data…