Atlas

Benchmarks

← All benchmarks

LegalBench

Professional Work · 2022-08-19

LegalBench evaluates legal reasoning across 162 open-source tasks organized into six reasoning types. Scores are reported as percentage performance across tasks.

Top models (higher is better)

ModelScore
Claude Fable 588.6
Gemini 3.1 Pro Preview87.4
Gemini 3 Pro Preview87.0
Claude Opus 587.0
GPT-5.6 Sol87.0
Gemini 3 Flash Preview86.9
Gemini 3.6 Flash86.7
GPT-5.586.5
GPT-5.486.0
GPT-586.0
Kimi K386.0
Grok 4.586.0
GPT-5.185.7
MiniMax M385.4
Opus 4.685.3
Opus 4.785.3
GPT-5.6 Terra85.1
Qwen3.5 Plus (2026-02-15)85.1
Muse Spark 1.185.0
Qwen3.7-Max84.9
Kimi K2.684.7
Opus 4.584.6
Grok 4.384.5
GLM-5.184.4
Gemini 2.5 Pro Experimental 03-2584.3
Qwen3.5-Flash84.3
Qwen3.6 Plus (2026-04-02)84.2
Muse Spark84.2
Sonnet 4.584.1
Gemini 3.5 Flash-Lite84.1
GLM-5.284.1
GLM-584.1
GPT-5.6 Luna84.0
MiniMax M2.784.0
Sonnet 583.9
Gemini 2.5 Flash Preview 04-1783.8
Gemini 3.1 Flash-Lite Preview83.8
o383.8
Gemini 3.5 Flash83.6
Opus 4.883.6
Loading Atlas data…