Atlas

Benchmarks

← All benchmarks

PrinzBench Search

Search · 2026-01-19

The search subscore of PrinzBench covers 8 needle-in-the-haystack search questions, each asked three times, for a maximum of 24 points. It measures a model's ability to find obscure publicly available information online.

Top models (higher is better)

ModelScore
GPT-5.6 Sol Pro24.0
GPT-5.4 Pro20.0
GPT-5.5 Pro19.0
GPT-5.419.0
GPT-5.518.0
GPT-5.211.0
GPT-5.3-Codex11.0
Kimi K311.0
Gemini 3.1 Pro Preview9.0
Grok 4.209.0
Claude Fable 57.0
Opus 4.87.0
Gemini 3 Flash Preview7.0
Kimi K2.57.0
Muse Spark7.0
Qwen3 Max (rolling alias)7.0
Grok 47.0
Gemini 3 Pro Preview6.0
Grok 4.16.0
DeepSeek-V4-Pro6.0
GLM-5.25.0
Opus 4.74.0
Kimi K2 Thinking4.0
Opus 4.61.0
Sonnet 4.50.0
Opus 4.50.0
Sonnet 4.60.0
Loading Atlas data…