Atlas

Benchmarks

← All benchmarks

PrinzBench

Professional Work · 2026-01-19

PrinzBench is a private legal-research benchmark that evaluates models on legal reasoning and obscure public-information search tasks. The public leaderboard reports a total score out of 99 points plus legal research and search subtotals.

Top models (higher is better)

ModelScore
GPT-5.6 Sol Pro91.0
GPT-5.5 Pro82.0
GPT-5.4 Pro79.0
GPT-5.574.0
GPT-5.469.0
Claude Fable 556.0
GPT-5.252.0
GPT-5.3-Codex52.0
Gemini 3.1 Pro Preview50.0
Kimi K347.0
Grok 4.2043.0
Opus 4.842.0
Gemini 3 Flash Preview36.0
Gemini 3 Pro Preview35.0
Kimi K2.535.0
Muse Spark31.0
GLM-5.230.0
Grok 4.125.0
Qwen3 Max (rolling alias)25.0
Opus 4.725.0
Grok 423.0
DeepSeek-V4-Pro23.0
Kimi K2 Thinking22.0
Sonnet 4.520.0
Opus 4.619.0
Opus 4.514.0
Sonnet 4.68.0
Loading Atlas data…