Atlas

Benchmarks

← All benchmarks

RadLE 2.0 Safety Index (RadLE-S)

Multimodal

RadLE-S measures protection against confidence-weighted diagnostic errors. Incorrect answers receive larger penalties at higher confidence, while an explicit 'I don't know' receives no error penalty.

Top models (higher is better)

ModelScore
Human Expert Baseline (RadLE 2.0)67.0
Claude Fable 556.8
OctoMed-7B52.3
Muse Spark 1.148.0
Nemotron 3 Nano Omni 30B A3B47.1
Grok 4.543.1
GPT-5.6 Sol Pro39.9
Gemini 3.1 Pro Preview34.3
Qwen3.7-Plus32.4
MiniMax M330.8
MedGemma 1.5 4B IT27.3
Lingshu-32B26.3
Gemma 4 31B (RadLE 2.0 label)25.8
GLM 5V Turbo25.3
InternVL3.5-8B23.7
Llama 4 Maverick (RadLE 2.0 label)19.4
Mistral Large 3 2512 (RadLE 2.0 label)17.7
Loading Atlas data…