Atlas

Benchmarks

← All benchmarks

DAYJOB: Healthcare

Professional Work · 2026-09-23

Surge AI DAYJOB: Healthcare evaluates professional judgment on 50 expert-designed healthcare assignments in rich file environments. Each task requires complete rubric satisfaction. The leaderboard averages task rewards over five attempts, excludes errored trials, and reports the unweighted mean across tasks. Runs use the DAYJOB OpenHands SDK harness in Harbor with no browsing or package downloads and Claude Opus 4.8 agentic grading.

Top models (higher is better)

ModelScore
Claude Opus 5.524.7
GPT-6 Astra11.6
Claude Fable 5.19.6
Claude Opus 58.4
Grok 4.78.4
Muse Spark 1.37.8
Claude Fable 55.6
GPT-6 Sol3.6
Grok 4.62.8
Muse Spark 1.22.0
GPT-5.6 Sol1.6
GPT-5.6 Terra1.6
Kimi K31.2
Gemini 3.8 Flash0.8
GLM-5.3 Flash0.4
GLM-5.30.4
GPT-5.6 Luna0.4
Hy30.4
Sonnet 50.0
Gemini 3.1 Pro Preview0.0
Gemini 3.7 Flash0.0
GPT-6 Luna0.0
Inkling0.0
Kimi K2.7 Code0.0
Mistral Large 3 675B Instruct 25120.0
Muse Glimmer 30B0.0
Loading Atlas data…