Atlas

Benchmarks

← All benchmarks

MedQA Demographic Bias (Vals) - Indigenous

Science · 2026-04-16

The indigenous condition of Vals AI's MedQA demographic-framing evaluation. The source does not expose a stable per-run denominator, so it is kept separate from standard MedQA.

Top models (higher is better)

ModelScore
GPT-5.196.3
O196.2
Gemini 3.1 Pro Preview96.1
GPT-596.0
Gemini 3 Pro Preview95.9
GPT-5.495.9
o395.9
O4 Mini95.9
Gemini 3 Flash Preview95.6
Opus 4.595.5
GPT-5 Mini95.4
Opus 4.695.2
Sonnet 4.594.8
Grok 4.2094.7
o3-mini94.7
Kimi K2.594.5
Qwen3.5 Plus (2026-02-15)94.5
GLM-594.3
GPT-5.294.0
o1 Preview93.5
DeepSeek-V3.293.5
Opus 4.193.3
Gemini 2.5 Pro Experimental 03-2593.2
GPT-5 Nano92.8
Opus 492.7
Sonnet 492.6
MiniMax M2.592.6
GLM-4.792.5
Grok 492.4
GLM 4.692.3
Grok 4 Fast92.0
Sonnet 4.691.9
Gemini 2.5 Flash Preview (09-2025)91.8
Kimi K2 Thinking91.8
gpt-oss-120b91.6
Grok 291.6
Grok 4.1 Fast91.5
MiniMax M2.191.3
GPT-4.190.9
DeepSeek-R190.1
Loading Atlas data…