Atlas

Benchmarks

← All benchmarks

LegalBench - Conclusion Tasks

Professional Work · 2023-08-18

The Conclusion Tasks split of LegalBench. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 591.8
Claude Opus 591.6
Gemini 3.6 Flash91.1
GPT-590.9
Kimi K390.7
GPT-5.6 Sol90.5
Gemini 3 Pro Preview90.4
GPT-5.6 Terra90.3
GPT-5.290.2
GLM-4.790.1
Gemini 3 Flash Preview90.1
Kimi K2 Thinking90.0
Opus 4.790.0
Qwen3.5 Plus (2026-02-15)89.9
Grok 4.389.9
Qwen3.7-Max89.8
GPT-5.589.6
GLM-5.189.6
Sonnet 589.6
Grok 4.589.5
Muse Spark89.5
Opus 4.589.4
GPT-5.189.4
Kimi K2.689.4
MiniMax M2.789.3
MiniMax M389.3
Gemini 3.1 Pro Preview89.3
Qwen3.6 Plus (2026-04-02)89.2
DeepSeek-V4-Pro89.1
Inkling89.0
Opus 4.189.0
GPT-5.488.9
Opus 4.888.9
Sonnet 4.588.9
GPT-5.6 Luna88.9
GLM-588.8
Opus 4.688.8
GLM-4.588.6
GLM-5.288.6
Qwen3.5-Flash88.5
Loading Atlas data…