Atlas

Benchmarks

← All benchmarks

MMLU Pro - Law

General QA · 2024-06-03

The Law split of MMLU Pro. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Opus 586.6
Claude Fable 586.5
Gemini 3.1 Pro Preview84.1
Gemini 3 Pro Preview82.5
Opus 4.782.1
Grok 4.582.0
Opus 4.881.9
Gemini 3.5 Flash80.4
Gemini 3.6 Flash80.1
Opus 4.179.9
Opus 4.679.7
Qwen3.7-Max79.5
GPT-5.6 Sol79.1
MiniMax M2.178.9
Sonnet 578.7
Opus 4.578.7
Gemini 3 Flash Preview78.5
Kimi K377.0
GPT-5.576.9
Muse Spark 1.176.5
GPT-5.175.8
Qwen3.6 Plus (2026-04-02)75.7
GPT-5.475.5
GPT-575.3
Gemini 3.1 Flash-Lite Preview75.0
Muse Spark75.0
Sonnet 4.574.9
Opus 474.6
GPT-5.6 Terra74.4
Grok 4.374.4
Kimi K2.674.3
DeepSeek-V4-Pro74.0
GLM-5.174.0
Qwen3.5 Plus (2026-02-15)73.9
Sonnet 4.673.6
GPT-5.273.5
o373.3
GPT-5.6 Luna73.0
Grok 4.2072.9
Nemotron 3 Ultra 550B A55B72.9
Loading Atlas data…