Atlas

Benchmarks

← All benchmarks

MedCode

Professional Work · 2026-02-19

Healthcare benchmark testing whether models can support medical billing and coding workflows. Scores are reported as task accuracy.

Top models (higher is better)

ModelScore
Claude Opus 563.6
Gemini 3.1 Pro Preview59.1
Claude Fable 556.1
Gemini 3 Flash Preview55.9
Gemini 3.5 Flash55.8
Opus 4.754.9
Opus 4.853.2
Gemini 3.6 Flash53.2
GPT-5.152.7
Gemini 3 Pro Preview52.2
Muse Spark51.3
Gemini 2.5 Pro50.6
GPT-5.249.7
GPT-549.6
Opus 4.549.2
Opus 4.649.1
GPT-5.549.1
Kimi K348.9
Gemini 3.1 Flash-Lite Preview47.6
o347.3
Opus 4.147.2
MiniMax M346.3
Sonnet 4.544.1
GPT-5.6 Sol44.0
Gemini 3.5 Flash-Lite43.5
GPT-5.6 Terra43.4
Grok 4.543.3
GPT-5 Mini43.0
GPT-5.6 Luna42.4
GLM-5.141.6
GPT-5.441.3
Inkling41.2
GPT-5.4 Nano41.0
GLM-5.240.8
Gemini 2.5 Flash Preview (09-2025)40.5
DeepSeek-V4-Pro40.5
Gemini 2.5 Flash40.4
Kimi K2.640.1
Kimi K2.539.3
Qwen3.7-Max38.8
Loading Atlas data…