Atlas

Benchmarks

← All benchmarks

MLCR-AA Completeness (Judged Responses)

Professional Work

MLCR-AA completeness among responses sent to the judge panel. It uses the conditional judged-response denominator and does not penalize excluded overlong or empty responses.

Top models (higher is better)

ModelScore
Claude Fable 5.189.0
Claude Opus 586.1
Claude Fable 573.8
Sonnet 568.2
GLM-5.3 Flash63.8
GLM-5.362.0
Sonnet 4.657.9
Opus 4.852.0
Muse Spark 1.251.7
Muse Spark 1.349.7
Kimi K345.1
Opus 4.740.3
GPT-6 Astra36.8
MiniMax M334.7
Muse Glimmer 30B33.9
GPT-5.6 Terra33.9
GPT-5.6 Sol27.6
DeepSeek V4.1 Flash27.0
Gemini 3.8 Flash26.9
DeepSeek-V4-Pro26.3
Qwen3.8 27B25.6
Inkling24.7
DeepSeek V4 Pro 081323.4
Gemini 3.5 Flash23.3
Qwen3.8-Max23.2
Qwen3.8 Max (0902)22.1
GPT-5.6 Luna21.8
Kimi K2.7 Code21.6
Step 5 Preview21.3
Gemini 3.7 Flash20.9
Nemotron 3 Ultra 550B A55B20.5
Gemini 3.6 Flash19.8
GPT-5.519.5
DeepSeek-V4-Flash19.4
Grok 4.718.8
Gemini 3 Flash Preview18.6
Gemini 3.1 Pro Preview18.4
MiMo-V2.5-Pro18.3
Haiku 4.517.8
Grok 4.517.5
Loading Atlas data…