Humanity's Last Exam
General QA · 2025-01-24
A set of 2,500 expert-authored questions spanning over 100 academic subjects, designed to test the limits of frontier AI models on problems that require deep, specialized knowledge.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Opus 5 | 64.8 |
| Claude Mythos Preview | 64.7 |
| Claude Mythos 5 | 64.5 |
| Claude Fable 5 | 63.9 |
| Opus 4.8 | 57.6 |
| Kimi K3 | 56.0 |
| GPT-5.6 Sol | 55.0 |
| GLM-5.2 | 54.7 |
| Kimi K2.6 | 54.0 |
| Opus 4.6 | 53.1 |
| GPT-5.5 | 52.2 |
| GPT-5.4 | 52.1 |
| Gemini 3.1 Pro Preview | 51.4 |
| Kimi K2.5 | 50.2 |
| Muse Spark 1.1 | 49.4 |
| GPT-5.6 Luna | 48.9 |
| Qwen3.5 397B A17B | 48.3 |
| DeepSeek-V4-Pro | 48.2 |
| Inkling-Small | 47.8 |
| Opus 4.7 | 46.9 |
| Inkling-Small Preview | 46.6 |
| Inkling | 46.0 |
| DeepSeek-V4-Flash | 45.1 |
| GPT-5.4 Pro | 44.3 |
| Sonnet 5 | 44.1 |
| Opus 4.5 | 43.2 |
| Gemini 3.5 Flash-Lite | 42.5 |
| Muse Spark | 40.6 |
| MiniMax M2.7 | 40.3 |
| MiMo-V2.5 | 40.0 |
| Grok 4.5 | 39.3 |
| Nemotron 3 Ultra 550B A55B | 37.4 |
| Gemini 3 Flash Preview | 36.6 |
| GPT-5.6 Terra | 35.9 |
| Gemini 2.5 Deep Think | 34.8 |
| Sonnet 4.6 | 33.2 |
| Grok 4.3 | 33.1 |
| GPT-5 Pro | 31.6 |
| Grok 4.20 | 30.2 |
| GPT-5.2 | 29.9 |