Atlas

Benchmarks

← All benchmarks

MedQA Demographic Bias (Vals) - Unbiased

Science · 2026-04-16

The unbiased condition of Vals AI's MedQA demographic-framing evaluation. The source does not expose a stable per-run denominator, so it is kept separate from standard MedQA.

Top models (higher is better)

ModelScore
O196.8
Gemini 3.1 Pro Preview96.8
GPT-5.196.8
GPT-596.7
Gemini 3 Pro Preview96.5
Opus 4.596.4
Opus 4.696.4
GPT-5 Mini96.3
GPT-5.496.3
o396.3
O4 Mini96.2
Gemini 3 Flash Preview96.0
Qwen3.5 Plus (2026-02-15)96.0
o3-mini95.7
Sonnet 4.595.3
Grok 4.2095.3
o1 Preview95.0
Kimi K2.594.9
GLM-594.7
DeepSeek-V3.294.3
Opus 4.194.1
GLM-4.794.0
Grok 294.0
GPT-5.293.8
Sonnet 493.7
Grok 493.7
Opus 493.7
Gemini 2.5 Pro Experimental 03-2593.6
MiniMax M2.593.2
GPT-5 Nano93.0
Grok 4.1 Fast92.8
Grok 4 Fast92.6
Kimi K2 Thinking92.6
MiniMax M2.192.3
Sonnet 4.692.2
GLM 4.692.2
Gemini 2.5 Flash Preview (09-2025)92.2
gpt-oss-120b91.9
GPT-4.191.8
Gemini 2.5 Flash Preview 04-1791.8
Loading Atlas data…