Atlas

Benchmarks

← All benchmarks

MedQA Demographic Bias (Vals)

Science · 2026-04-16

Vals AI's demographic-framing MedQA evaluation. The headline is the macro-average of six demographic conditions, not a direct run on the standard 1,273-item MedQA test.

Top models (higher is better)

ModelScore
O196.5
GPT-5.196.4
Gemini 3.1 Pro Preview96.4
GPT-596.3
GPT-5.496.1
GPT-5 Mini96.1
o396.1
Gemini 3 Pro Preview96.0
O4 Mini96.0
Opus 4.595.9
Gemini 3 Flash Preview95.8
Opus 4.695.4
Qwen3.5 Plus (2026-02-15)95.2
o3-mini94.8
Sonnet 4.594.7
Grok 4.2094.5
Kimi K2.594.4
GLM-594.3
GPT-5.294.1
DeepSeek-V3.293.9
GLM-4.793.7
Opus 4.193.6
GPT-5 Nano93.3
Gemini 2.5 Pro Experimental 03-2593.1
o1 Preview93.0
Opus 492.9
Sonnet 492.7
Kimi K2 Thinking92.6
MiniMax M2.592.5
Grok 492.5
Grok 292.3
GLM 4.692.2
Grok 4.1 Fast92.1
Grok 4 Fast92.1
Sonnet 4.692.1
Gemini 2.5 Flash Preview (09-2025)91.4
gpt-oss-120b91.4
GPT-4.191.2
MiniMax M2.191.2
Gemini 2.5 Flash Preview 04-1791.0
Loading Atlas data…