Atlas

Benchmarks

← All benchmarks

LegalBench - Issue Tasks

Professional Work · 2023-08-18

The Issue Tasks split of LegalBench. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 592.1
Claude Opus 591.9
Gemini 3.1 Pro Preview91.5
GPT-5.6 Sol91.4
GPT-5.591.2
Gemini 3 Pro Preview91.2
Qwen3.5 Plus (2026-02-15)91.2
Gemini 3 Flash Preview91.1
Gemini 3.6 Flash91.1
Kimi K391.1
Qwen3.5-Flash90.9
MiniMax M390.9
Opus 4.690.7
GPT-5.490.5
Grok 4.590.1
Kimi K2.690.1
GPT-5.190.0
Qwen3.7-Max89.7
Qwen3.6 Plus (2026-04-02)89.7
GPT-589.5
GLM-5.289.5
Gemini 2.5 Flash Preview 04-1789.5
Grok 489.4
GPT-5.6 Terra89.4
Gemini 3.1 Flash-Lite Preview89.4
Gemini 3.5 Flash-Lite89.3
Grok 4.1 Fast89.3
Grok 4.389.2
GLM-5.189.0
Muse Spark 1.189.0
Opus 4.788.9
Opus 4.588.9
Muse Spark88.8
GLM-4.788.7
Sonnet 488.7
GPT-5.6 Luna88.7
Sonnet 4.588.6
Opus 4.188.5
GPT-5.288.3
Sonnet 588.2
Loading Atlas data…