Atlas

Benchmarks

← All benchmarks

SimpleBench

Classic NLP · 2024-08-20

SimpleBench tests everyday commonsense reasoning with more than 200 multiple-choice questions spanning spatial and temporal reasoning, social intelligence, and adversarial trick questions. The official MCQ leaderboard reports accuracy averaged across five runs (AVG@5).

Top models (higher is better)

ModelScore
Claude Fable 581.9
Claude Opus 580.6
Gemini 3.1 Pro Preview79.6
GPT-5.5 Pro76.9
Gemini 3.5 Flash76.7
Gemini 3 Pro Preview76.4
GPT-5.6 Sol Pro71.7
Qwen3.7-Max70.4
Grok 4.570.0
GPT-5.569.0
Opus 4.667.6
Opus 4.864.8
GPT-5.6 Sol64.8
Qwen3.6-Max-Preview63.0
Gemini 2.5 Pro Preview 06-0562.4
Opus 4.562.0
GPT-5 Pro61.6
Gemini 3 Flash Preview61.1
Kimi K360.7
Sonnet 560.6
Grok 460.5
Opus 4.160.0
Opus 458.8
GLM-5.258.8
Kimi K2.7 Code57.9
GPT-5.2 Pro57.4
GPT-556.7
Grok 4.1 Fast56.0
GLM-5.155.1
Sonnet 4.554.3
GPT-5.153.2
GLM-553.2
o353.1
DeepSeek-V3.2-Speciale52.6
Gemini 2.5 Pro Experimental 03-2551.6
Gemini 2.5 Pro Preview 03-2551.6
Inkling50.0
GPT-5.6 Terra48.9
GLM-4.747.7
Kimi K2.546.8
Loading Atlas data…