Atlas

Benchmarks

← All benchmarks

SimpleQA Verified (Epoch anti-abstention)

General QA · 2026-08-27

Epoch's August 27, 2026 protocol for the 1,000-question SimpleQA Verified dataset adds an explicit guessing instruction that discourages abstention. Scores are percentage correct, rather than Google's F1 measure. Kept separate from bare-question evaluations.

Top models (higher is better)

ModelScore
GPT-6 Astra75.6
Claude Fable 5.170.8
Gemini 3.8 Flash69.7
Gemini 3.7 Flash69.2
Gemini 3 Flash Preview66.8
Gemini 3.5 Flash66.2
Gemini 3.6 Flash66.2
GPT-5.563.0
Muse Spark 1.260.3
Muse Spark 1.157.8
Qwen3.7-Max55.8
Opus 4.853.0
DeepSeek V4 Pro 081352.9
Qwen3.6-Max-Preview52.0
Opus 4.751.7
Kimi K350.6
GPT-550.1
o349.4
Grok 4.649.3
Qwen3-Max (2025-09-23)48.7
Grok 4.548.3
GPT-5.148.0
Qwen3.8 Max (0902)47.3
Opus 4.647.0
DeepSeek-V4-Pro47.0
GPT-5.4 Pro46.3
Qwen3.8-Max45.8
Opus 4.545.7
GPT-5.445.1
Qwen3.6 Plus (2026-04-02)44.1
O141.1
GLM-5.341.0
Qwen3 235B A22B Thinking 250740.4
Inkling40.3
GPT-5.237.1
Kimi K2.7 Code36.5
Kimi K2.534.3
GLM-5.234.2
GLM-5.134.0
Sonnet 533.7
Loading Atlas data…