Atlas

Benchmarks

← All benchmarks

Legal Research Bench Administrative/Regulatory

Professional Work · 2026-06-23

This row reports the practice-area score for Administrative/Regulatory tasks in Vals AI Legal Research Bench.

Top models (higher is better)

ModelScore
Claude Opus 565.2
GPT-5.6 Sol60.6
Claude Fable 557.6
GPT-5.6 Terra57.6
Sonnet 554.5
Kimi K354.5
GPT-5.553.0
Grok 4.551.5
GPT-5.6 Luna48.5
Opus 4.843.9
Sonnet 4.643.9
Gemini 3.5 Flash43.9
GLM-5.239.4
Muse Spark 1.137.9
MiniMax M336.4
Qwen3.7-Max36.4
Gemini 3.6 Flash31.8
GLM-5.131.8
Inkling31.8
DeepSeek-V4-Pro28.8
Inkling-Small28.8
Grok 4.325.8
Gemini 3.1 Pro Preview24.2
Gemini 3.5 Flash-Lite19.7
Kimi K2.618.2
GPT-5.4 Mini15.2
Laguna M.13.0
Laguna XS.21.5
Loading Atlas data…