Atlas

Benchmarks

← All benchmarks

MMLU Clinical Knowledge (Open Medical-LLM)

Science · 2024-04-19

The clinical-knowledge subset of MMLU, 265 questions, scored by the Open Medical-LLM Leaderboard under lm-evaluation-harness with a fixed prompt.

Top models (higher is better)

ModelScore
GPT-486.4
Llama 3 8B74.7
GPT-3.5 Turbo 110674.7
Solar 10.7B Instruct V1.072.1
Llama 3 8B Instruct70.9
Gemma 7B69.4
Mistral 7B v0.1 Base68.7
Qwen1.5 7B Chat68.3
Qwen1.5 7B66.0
Gemma 1.1 7B IT64.9
Zephyr 7B Beta64.5
Mistral 7B Instruct v0.161.1
Gemma 7B IT55.1
Phi-1.546.0
Gemma 2B35.5
Falcon 7B21.9
Loading Atlas data…