Atlas

Benchmarks

← All benchmarks

MedScribe

Professional Work · 2026-02-19

Clinical documentation benchmark testing whether models can help doctors with administrative writing tasks such as notes, summaries, and structured medical documentation.

Top models (higher is better)

ModelScore
Claude Opus 591.0
Muse Spark 1.188.9
Claude Fable 588.5
GPT-5.188.1
Kimi K388.0
MiniMax M387.3
Grok 4.586.9
GPT-5.586.9
Opus 4.686.7
Muse Spark85.9
Opus 4.885.8
Inkling85.4
Opus 4.585.3
GPT-5.6 Sol85.2
Haiku 4.585.2
Sonnet 4.584.5
GPT-5.6 Luna84.4
GPT-5.284.4
MiMo-V2.5-Pro83.7
GPT-583.7
GLM-5.283.5
Gemini 2.5 Flash83.0
Opus 4.783.0
GPT-5.6 Terra82.9
Grok 4 Fast81.6
MiniMax M2.180.8
GPT-5 Mini80.6
MiniMax M2.779.9
Gemini 3.6 Flash79.7
Qwen3.7-Max79.4
Grok 4.1 Fast78.7
Gemini 2.5 Flash Preview (09-2025)78.5
Grok 478.2
Kimi K2.678.1
GPT-5.477.5
Qwen3-VL-Plus-2025-09-2377.1
GPT-5.4 Nano77.1
Qwen3.6 Plus (2026-04-02)77.0
o376.7
Gemini 3.5 Flash76.6
Loading Atlas data…