Atlas

Benchmarks

← All benchmarks

PrinzBench Legal Research

Professional Work · 2026-01-19

The legal-research subscore of PrinzBench covers 25 legal research questions, each asked three times, for a maximum of 75 points. It measures a model's ability to locate and analyze relevant public legal authorities.

Top models (higher is better)

ModelScore
GPT-5.6 Sol Pro67.0
GPT-5.5 Pro63.0
GPT-5.4 Pro59.0
GPT-5.556.0
GPT-5.450.0
Claude Fable 549.0
GPT-5.241.0
GPT-5.3-Codex41.0
Gemini 3.1 Pro Preview41.0
Kimi K336.0
Opus 4.835.0
Grok 4.2034.0
Gemini 3 Flash Preview29.0
Gemini 3 Pro Preview29.0
Kimi K2.528.0
GLM-5.225.0
Muse Spark24.0
Opus 4.721.0
Sonnet 4.520.0
Grok 4.119.0
Qwen3 Max (rolling alias)18.0
Kimi K2 Thinking18.0
Opus 4.618.0
DeepSeek-V4-Pro17.0
Grok 416.0
Opus 4.514.0
Sonnet 4.68.0
Loading Atlas data…