Atlas

Benchmarks

← All benchmarks

GPQA Diamond

General QA · 2023-11-20

The hardest GPQA subset, with graduate-level Google-proof questions in biology, physics, and chemistry that require deep domain reasoning. Scores are reported as accuracy.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview96.0
GPT-5.595.5
GPT-5.6 Sol94.9
Opus 4.794.2
Claude Mythos 594.1
GPT-5.5 Pro93.9
Kimi K393.4
GPT-5.6 Terra93.3
GPT-5.2 Pro93.2
Grok 4.392.9
Grok 4.592.9
MiniMax M392.9
Claude Mythos Preview92.9
GPT-5.492.8
GPT-5.3-Codex92.6
Claude Fable 592.6
Claude Opus 592.4
Gemini 3.6 Flash92.4
GPT-5.6 Luna92.4
Interfaze Beta92.4
Opus 4.892.0
GPT-5.291.9
Muse Spark 1.191.9
Gemini 3.5 Flash91.4
GLM-5.291.4
Opus 4.691.3
Gemini 3 Pro Preview90.9
Sonnet 590.5
DeepSeek-V4-Pro90.4
Sonnet 4.689.9
Grok 4.2089.9
Kimi K2.689.9
Qwen3.7-Max89.9
Kimi K2.7 Code89.5
Inkling-Small89.5
Gemini 3 Flash Preview89.4
Qwen3.6-Max-Preview89.1
Muse Spark88.4
Qwen3.6 Plus (2026-04-02)88.4
Inkling-Small Preview88.3
Loading Atlas data…