Atlas

Benchmarks

← All benchmarks

GPQA Diamond (Vals protocol average)

General QA · 2026-07-10

Vals AI's GPQA Diamond Overall panel averages each model's Few-Shot CoT and Zero-Shot CoT accuracy. It is separated from either individual prompting protocol so the derived average does not create conflicting observations on the canonical GPQA Diamond panel.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview95.5
GPT-5.6 Sol95.2
Claude Opus 593.4
Gemini 3.6 Flash93.4
Claude Fable 593.2
GPT-5.593.2
Grok 4.592.9
Kimi K392.9
Gemini 3.5 Flash92.7
MiniMax M392.7
Opus 4.892.4
Gemini 3 Pro Preview91.7
GPT-5.291.7
GPT-5.491.7
GPT-5.6 Luna91.7
Grok 4.391.4
Muse Spark 1.191.2
GPT-5.6 Terra90.9
Opus 4.790.2
Qwen3.7-Max90.2
Opus 4.689.6
Muse Spark89.6
DeepSeek-V4-Pro89.4
Kimi K2.689.1
Sonnet 588.9
Grok 4.2088.6
Grok 488.1
Gemini 3 Flash Preview87.9
Qwen3.5 Plus (2026-02-15)87.4
Qwen3.6 Plus (2026-04-02)87.4
Inkling87.1
GPT-5.186.6
MiniMax M2.786.6
Nemotron 3 Ultra 550B A55B86.1
Opus 4.585.9
Sonnet 4.685.6
GLM-5.285.6
GPT-585.6
Grok 4 Fast85.4
Qwen3 Max Thinking (2026-01-23)84.8
Loading Atlas data…