GPQA Diamond (Vals protocol average)
General QA · 2026-07-10
Vals AI's GPQA Diamond Overall panel averages each model's Few-Shot CoT and Zero-Shot CoT accuracy. It is separated from either individual prompting protocol so the derived average does not create conflicting observations on the canonical GPQA Diamond panel.
Top models (higher is better)
| Model | Score |
|---|---|
| Gemini 3.1 Pro Preview | 95.5 |
| GPT-5.6 Sol | 95.2 |
| Claude Opus 5 | 93.4 |
| Gemini 3.6 Flash | 93.4 |
| Claude Fable 5 | 93.2 |
| GPT-5.5 | 93.2 |
| Grok 4.5 | 92.9 |
| Kimi K3 | 92.9 |
| Gemini 3.5 Flash | 92.7 |
| MiniMax M3 | 92.7 |
| Opus 4.8 | 92.4 |
| Gemini 3 Pro Preview | 91.7 |
| GPT-5.2 | 91.7 |
| GPT-5.4 | 91.7 |
| GPT-5.6 Luna | 91.7 |
| Grok 4.3 | 91.4 |
| Muse Spark 1.1 | 91.2 |
| GPT-5.6 Terra | 90.9 |
| Opus 4.7 | 90.2 |
| Qwen3.7-Max | 90.2 |
| Opus 4.6 | 89.6 |
| Muse Spark | 89.6 |
| DeepSeek-V4-Pro | 89.4 |
| Kimi K2.6 | 89.1 |
| Sonnet 5 | 88.9 |
| Grok 4.20 | 88.6 |
| Grok 4 | 88.1 |
| Gemini 3 Flash Preview | 87.9 |
| Qwen3.5 Plus (2026-02-15) | 87.4 |
| Qwen3.6 Plus (2026-04-02) | 87.4 |
| Inkling | 87.1 |
| GPT-5.1 | 86.6 |
| MiniMax M2.7 | 86.6 |
| Nemotron 3 Ultra 550B A55B | 86.1 |
| Opus 4.5 | 85.9 |
| Sonnet 4.6 | 85.6 |
| GLM-5.2 | 85.6 |
| GPT-5 | 85.6 |
| Grok 4 Fast | 85.4 |
| Qwen3 Max Thinking (2026-01-23) | 84.8 |