Atlas

Benchmarks

← All benchmarks

Pencil Puzzle Bench - Direct Ask

Games · 2026-03-02

Pencil Puzzle Bench's Direct Ask setting presents 300 pencil puzzles directly to models. Scores report the percentage solved correctly.

Top models (higher is better)

ModelScore
Claude Fable 550.0
Opus 4.627.3
GPT-5.227.0
Gemini 3.1 Pro Preview20.0
GLM-5.216.0
Gemini 3.5 Flash13.0
Kimi K2.611.7
Sonnet 4.610.3
GPT-5.2 Pro9.7
GPT-5.17.7
Qwen3.7-Max7.3
Kimi K2.7 Code6.7
Opus 4.56.0
GPT-56.0
Kimi K2.56.0
Grok 4.1 Fast5.7
Qwen3.7-Plus5.3
Gemini 3 Flash Preview4.7
Gemini 3 Pro Preview4.3
DeepSeek-V4-Pro4.0
Grok 4.33.3
MiniMax M33.3
Nemotron 3 Ultra 550B A55B3.3
o33.0
Sonnet 4.52.3
DeepSeek-V3.2-Speciale2.3
DeepSeek-V3.22.0
Kimi K2 Thinking1.3
MiMo-V2-Pro1.0
GLM-50.7
MiniMax M2.50.7
MiniMax M2.70.7
O10.7
Qwen3.5 397B A17B0.7
Gemini 2.5 Pro0.3
Gemma 4 31B IT0.3
GLM-4.70.3
gpt-oss-120b0.3
Grok 4.200.3
Grok Code Fast 10.3
Loading Atlas data…