Atlas

Benchmarks

← All benchmarks

LegalBench - Interpretation Tasks

Professional Work · 2023-08-18

The Interpretation Tasks split of LegalBench. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash88.7
Claude Fable 586.9
Claude Opus 585.8
GPT-5.6 Sol84.4
Gemini 3 Pro Preview84.3
GPT-5.483.9
Gemini 3 Flash Preview83.9
Gemini 3.6 Flash83.9
GPT-5.583.8
Gemini 3.1 Pro Preview83.8
Opus 4.783.6
MiniMax M383.5
Grok 4.583.2
GPT-5.6 Terra83.2
Opus 4.683.2
GPT-583.0
Opus 4.583.0
Muse Spark 1.182.9
GPT-5.282.8
Gemini 2.5 Pro Experimental 03-2582.7
Opus 4.882.7
Qwen3.5-Flash82.7
Grok 482.7
Kimi K382.6
Sonnet 4.682.5
GPT-5.182.4
Qwen3.7-Max82.3
Kimi K2.682.2
GLM-5.282.2
GPT-5.6 Luna82.1
Sonnet 4.582.1
Qwen3.6 Plus (2026-04-02)82.0
Qwen3.5 Plus (2026-02-15)81.9
GLM-581.8
Muse Spark81.8
Grok 4.381.8
GLM-5.181.7
MiniMax M2.781.7
Gemini 2.5 Flash Preview 04-1781.6
Sonnet 581.4
Loading Atlas data…