Atlas

Benchmarks

← All benchmarks

Medical Long Context Reasoning (MLCR-AA)

Professional Work

Artificial Analysis' private held-out expert and compound subset of Wisedocs Medical Long Context Reasoning. Responses must be concise, nonempty, accurate and complete by majority vote of three judges; three attempts per question are averaged.

Top models (higher is better)

ModelScore
Claude Fable 5.171.1
Claude Fable 564.4
Claude Opus 559.4
Sonnet 555.0
GLM-5.3 Flash51.1
GLM-5.348.3
Opus 4.845.6
Muse Spark 1.343.3
Kimi K338.3
GPT-6 Astra35.0
GPT-5.6 Terra31.7
Muse Spark 1.231.1
Opus 4.728.9
GPT-5.6 Sol26.1
Sonnet 4.624.4
DeepSeek V4.1 Flash22.8
Gemini 3.8 Flash21.7
Qwen3.8 27B21.7
DeepSeek-V4-Pro21.1
Muse Glimmer 30B20.0
Qwen3.8 Max (0902)20.0
GPT-5.6 Luna19.4
Qwen3.8-Max19.4
Gemini 3.5 Flash18.3
DeepSeek V4 Pro 081317.8
GPT-5.517.8
MiniMax M317.2
Step 5 Preview16.7
GPT-6 Luna16.1
GPT-6 Sol16.1
Kimi K2.7 Code16.1
Gemini 3.1 Pro Preview15.6
DeepSeek-V4-Flash15.0
Gemini 3.7 Flash15.0
Grok 4.515.0
Grok 4.715.0
Gemini 3.6 Flash14.4
DeepSeek-V4-Flash-073113.3
Grok 4.612.2
Inkling12.2
Loading Atlas data…