Atlas

Benchmarks

← All benchmarks

LegalBench - Rule Tasks

Professional Work · 2023-08-18

The Rule Tasks split of LegalBench. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 588.3
Gemini 3.1 Pro Preview88.3
Gemini 3.5 Flash88.0
GPT-5.6 Sol86.4
Gemini 3.6 Flash85.7
GPT-585.7
GPT-5.585.5
Gemini 3 Flash Preview85.3
Gemini 3 Pro Preview85.2
Opus 4.785.0
Kimi K384.8
Claude Opus 584.8
Grok 4.584.2
GPT-5.484.0
GPT-5.183.6
Muse Spark 1.183.6
Opus 4.682.4
Gemini 3.1 Flash-Lite Preview82.2
Claude 3.7 Sonnet82.1
Gemini 3.5 Flash-Lite81.7
Opus 4.581.6
Gemini 2.5 Pro Experimental 03-2581.4
Qwen3.5 Plus (2026-02-15)81.3
GLM-581.2
Qwen3.7-Max81.2
Sonnet 481.1
MiniMax M2.781.0
MiniMax M381.0
Grok 4.380.8
Kimi K2.680.6
GLM-5.180.6
GPT-5.6 Terra80.5
GPT-4 Turbo80.3
GPT-4.180.2
o380.2
Sonnet 4.580.1
Opus 4.880.0
Muse Spark79.9
Nemotron 3 Ultra 550B A55B79.4
Qwen3 Max (rolling alias)79.4
Loading Atlas data…