Atlas

Benchmarks

← All benchmarks

MedQA Demographic Bias (Vals) - Hispanic

Science · 2026-04-16

The hispanic condition of Vals AI's MedQA demographic-framing evaluation. The source does not expose a stable per-run denominator, so it is kept separate from standard MedQA.

Top models (higher is better)

ModelScore
GPT-5.196.5
O196.5
o396.2
GPT-596.0
GPT-5 Mini96.0
Gemini 3.1 Pro Preview96.0
O4 Mini95.9
GPT-5.495.7
Gemini 3 Pro Preview95.5
Gemini 3 Flash Preview95.4
Opus 4.595.2
Qwen3.5 Plus (2026-02-15)94.8
o3-mini94.5
Opus 4.694.4
GPT-5.294.3
Sonnet 4.594.1
Grok 4.2094.1
Kimi K2.594.1
GLM-594.0
DeepSeek-V3.293.8
o1 Preview93.7
Opus 4.193.5
GLM-4.793.5
GPT-5 Nano93.3
Kimi K2 Thinking92.9
Opus 492.4
MiniMax M2.592.3
Gemini 2.5 Pro Experimental 03-2592.3
GLM 4.692.0
Grok 492.0
Grok 4 Fast92.0
Sonnet 491.9
Sonnet 4.691.9
Grok 4.1 Fast91.8
Grok 291.7
Gemini 2.5 Flash Preview (09-2025)91.2
gpt-oss-120b91.2
MiniMax M2.191.1
GPT-4.191.0
Gemini 2.5 Flash Preview 04-1790.9
Loading Atlas data…