Atlas

Benchmarks

← All benchmarks

Humanity's Last Exam RMS Calibration Error (CAIS)

General QA · 2025-01-24

RMS calibration error on Humanity's Last Exam measures how closely a model's stated confidence matches its observed accuracy across expert-written academic questions. Lower calibration error indicates better confidence calibration.

Top models (lower is better)

ModelScore
Muse Spark 1.125.3
Claude Fable 525.5
Opus 4.826.4
Opus 4.728.1
Grok 4.530.8
GPT-5.440.9
GPT-5.541.8
GLM-5.242.0
Grok 4.342.5
Sonnet 4.643.1
GPT-5.243.7
Kimi K344.7
Grok 4.2045.8
Opus 4.646.0
GPT-5.6 Sol46.7
GPT-5.4 Nano47.1
GPT-5.147.8
GPT-550.0
Gemini 3.1 Pro Preview50.3
GPT-5.6 Terra50.7
Gemini 3.5 Flash53.5
Gemini 3 Flash Preview55.1
GPT-5.4 Mini55.2
GPT-5.6 Luna55.7
Grok 456.4
Opus 4.556.9
DeepSeek-V4-Pro57.1
Gemini 3 Pro Preview57.2
Kimi K2.658.2
GLM-5.158.5
DeepSeek-V3.258.8
Haiku 4.560.5
Sonnet 4.564.1
GPT-5 Mini65.0
Kimi K2 Thinking67.8
Grok 4 Fast68.7
Gemini 2.5 Pro Preview 03-2571.0
Gemini 2.5 Pro72.0
Grok 4.1 Fast72.1
Gemini 3.1 Flash-Lite Preview72.8
Loading Atlas data…