Atlas

Benchmarks

← All benchmarks

HealthBench

Professional Work · 2025-05-12

OpenAI's healthcare benchmark of 5,000 multi-turn conversations, scored against 48,562 conversation-specific rubric criteria written by 262 physicians and applied by a model grader.

Top models (higher is better)

ModelScore
Claude Opus 567.1
GPT-5.263.3
GPT-563.0
GPT-5.462.6
Claude Mythos 562.5
gpt-oss-120b61.7
Sonnet 559.2
Opus 4.858.8
DeepSeek-R1-052855.7
GPT-5.2 Instant55.4
GPT-5.3 Instant54.1
DeepSeek-V3.152.5
DeepSeek-R150.5
Opus 441.7
Loading Atlas data…