Atlas

Benchmarks

← All benchmarks

Harvey HLAB - Criteria Pass Rate - Arbitration International Dispute Resolution

Professional Work · 2026-05-06

The Arbitration International Dispute Resolution practice-area split of Harvey's Legal Agent Benchmark held-out evaluation criteria pass rate. This reports pooled rubric criteria passed within that split and is distinct from the all-pass task-score split.

Top models (higher is better)

ModelScore
Muse Spark 1.194.3
Grok 4.592.1
Kimi K392.1
GLM-5.291.8
Claude Fable 591.4
Claude Opus 590.3
Opus 4.888.2
Sonnet 587.5
MiniMax M386.7
Sonnet 4.685.7
DeepSeek-V4-Pro83.5
GPT-5.6 Sol82.1
GPT-5.6 Luna81.7
Gemini 3.6 Flash78.9
Qwen3.7-Max78.9
Gemini 3.5 Flash78.5
GPT-5.578.5
GPT-5.6 Terra74.6
Grok 4.368.1
GPT-5.466.7
Gemini 3.5 Flash-Lite63.8
Qwen3.7-Plus58.4
GLM-5.153.4
Kimi K2.650.2
Inkling49.5
Laguna XS.243.7
Laguna M.141.9
Loading Atlas data…