Atlas

Benchmarks

← All benchmarks

LegalBench - Rhetoric Tasks

Professional Work · 2023-08-18

The Rhetoric Tasks split of LegalBench. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview84.1
Gemini 3 Pro Preview84.1
Gemini 3 Flash Preview83.9
Claude Fable 583.8
Gemini 3.5 Flash83.4
GPT-5.182.9
GPT-5.282.9
GPT-5.482.8
Grok 4.582.8
GPT-5.6 Luna82.7
Grok 482.7
MiniMax M382.5
GPT-5.582.4
Gemini 2.5 Flash Preview 04-1782.2
Muse Spark 1.182.1
GPT-5.6 Terra82.1
Gemini 2.5 Pro Experimental 03-2582.1
GPT-5.6 Sol82.1
Gemini 3.6 Flash81.7
Qwen3.7-Max81.7
Grok 3 Mini81.6
Grok 381.6
o381.5
Opus 4.681.5
Qwen3 Max (rolling alias)81.4
Gemini 2.5 Flash Preview (09-2025)81.4
Kimi K2.681.4
Grok 4 Fast81.3
GLM-5.281.3
Qwen3 Max Preview81.2
Qwen3.5 Plus (2026-02-15)81.2
Grok 4.1 Fast81.2
Kimi K2 Instruct81.1
GLM-5.181.1
Gemini 2.5 Flash-Lite Preview (09-2025)81.1
Muse Spark81.1
Sonnet 581.1
DeepSeek-V381.1
Qwen3.6 Plus (2026-04-02)81.0
GPT-581.0
Loading Atlas data…