Atlas

Benchmarks

← All benchmarks

SimpleQA Verified

General QA · 2025-06-01

SimpleQA Verified contains 1,000 factoid questions covering politics, science and technology, art, sports, geography, music, and other topics. Scores report answer accuracy.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview77.3
GPT-5.6 Sol71.6
Gemini 3.6 Flash68.7
Gemini 3.5 Flash68.4
Claude Fable 568.3
Qwen3-Max (2025-09-23)67.5
Muse Spark66.3
GPT-5.5 Pro64.5
GPT-5.563.1
Qwen3.7-Max58.5
DeepSeek-V4-Pro57.0
Qwen3.6-Max-Preview56.9
Claude Opus 556.7
Grok 4.553.5
o353.0
Opus 4.750.6
GPT-550.6
Qwen3 235B A22B Thinking 250750.1
Qwen3.6 Plus (2026-04-02)49.1
Grok 447.9
GPT-5.4 Pro47.8
Opus 4.646.5
GPT-5.444.8
Gemini 3.5 Flash-Lite44.1
Inkling43.9
Gemini 3.1 Flash-Lite Preview43.3
GPT-5.6 Terra43.1
Kimi K342.7
Opus 4.541.8
GPT-5.6 Luna41.7
Opus 4.839.5
Kimi K2.7 Code39.2
Kimi K2.638.7
GPT-5.238.2
GLM-5.238.1
Grok 4.338.0
GLM-5.137.3
Grok 4.2035.1
Opus 4.134.8
DeepSeek-V4-Flash34.1
Loading Atlas data…