Atlas

Benchmarks

← All benchmarks

Harvey HLAB - Criteria Pass Rate - Litigation Dispute Resolution

Professional Work · 2026-05-06

The Litigation Dispute Resolution practice-area split of Harvey's Legal Agent Benchmark held-out evaluation criteria pass rate. This reports pooled rubric criteria passed within that split and is distinct from the all-pass task-score split.

Top models (higher is better)

ModelScore
Muse Spark 1.193.6
Grok 4.590.6
Opus 4.889.9
Sonnet 4.689.5
Kimi K389.5
Claude Fable 589.1
MiniMax M388.8
GPT-5.6 Luna86.9
Qwen3.7-Max86.9
Gemini 3.6 Flash86.5
GLM-5.286.5
Claude Opus 586.1
Sonnet 585.8
DeepSeek-V4-Pro84.6
GPT-5.6 Sol83.9
GPT-5.581.6
Gemini 3.5 Flash80.5
GPT-5.6 Terra77.2
GPT-5.476.8
Gemini 3.5 Flash-Lite74.9
GLM-5.169.3
Grok 4.367.4
Kimi K2.667.0
Qwen3.7-Plus65.5
Inkling59.6
Laguna M.149.7
Laguna XS.242.5
Loading Atlas data…