Atlas

Benchmarks

← All benchmarks

MLCR-AA Accuracy (Judged Responses)

Professional Work

MLCR-AA accuracy among nonempty responses meeting the conciseness limit and sent to the three-judge panel. This conditional denominator excludes overlong and empty responses.

Top models (higher is better)

ModelScore
GPT-6 Astra98.3
GPT-6 Sol96.7
Claude Fable 5.194.8
GPT-6 Luna93.8
GPT-5.6 Terra93.7
GPT-5.6 Sol92.5
Claude Fable 590.1
Qwen3.8-Max89.9
Qwen3.8 27B89.3
Opus 4.889.0
Claude Opus 588.6
GPT-5.587.4
Qwen3.8 Max (0902)86.6
Kimi K385.0
Grok 4.784.7
Sonnet 584.1
DeepSeek V4.1 Flash83.3
GPT-5.6 Luna82.8
Step 5 Preview82.8
DeepSeek V4 Pro 081381.4
GLM-5.381.3
Muse Spark 1.381.1
DeepSeek-V4-Pro80.7
DeepSeek-V4-Flash-073180.6
DeepSeek-V4-Flash80.6
Grok 4.677.7
GLM-5.3 Flash76.4
GPT-5.4 Mini75.4
GPT-5.4 Nano74.7
Sonnet 4.673.7
Gemini 3.1 Pro Preview72.1
Gemini 3.8 Flash69.7
Grok 4.569.5
Gemini 3.6 Flash68.4
Gemini 3.7 Flash67.8
Muse Spark 1.266.9
Gemini 2.5 Flash65.5
Opus 4.764.2
Kimi K2.7 Code64.2
GLM-5.262.2
Loading Atlas data…