Atlas

Benchmarks

← All benchmarks

MedQA Demographic Bias (Vals) - Asian

Science · 2026-04-16

The asian condition of Vals AI's MedQA demographic-framing evaluation. The source does not expose a stable per-run denominator, so it is kept separate from standard MedQA.

Top models (higher is better)

ModelScore
O196.4
o396.3
Gemini 3.1 Pro Preview96.3
Gemini 3 Pro Preview96.3
GPT-596.3
GPT-5 Mini96.2
GPT-5.496.2
GPT-5.196.1
O4 Mini96.0
Opus 4.596.0
Gemini 3 Flash Preview95.8
Opus 4.695.5
Qwen3.5 Plus (2026-02-15)95.0
o3-mini94.8
Sonnet 4.594.5
Grok 4.2094.3
Kimi K2.594.2
GLM-4.794.0
GLM-593.8
GPT-5.293.8
DeepSeek-V3.293.8
GPT-5 Nano93.5
Gemini 2.5 Pro Experimental 03-2593.4
Opus 492.9
GLM 4.692.8
Opus 4.192.8
MiniMax M2.592.6
Kimi K2 Thinking92.5
Sonnet 492.5
Grok 292.0
Grok 491.8
Grok 4 Fast91.8
Sonnet 4.691.6
Grok 4.1 Fast91.6
gpt-oss-120b91.4
Gemini 2.5 Flash Preview 04-1791.0
GPT-4.191.0
Gemini 2.5 Flash Preview (09-2025)90.8
Qwen3-235B-A22B90.5
DeepSeek-R190.5
Loading Atlas data…