MATH Level 5
Math · 2021-03-05
The hardest tier of problems from the MATH dataset, drawn from competitions like the AMC 10, AMC 12, and AIME.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5 | 98.1 |
| GPT-5 Mini | 97.8 |
| O4 Mini | 97.8 |
| o3 | 97.8 |
| Sonnet 4.5 | 97.7 |
| Qwen3-Max (2025-09-23) | 97.1 |
| DeepSeek-R1-0528 | 96.6 |
| o3-mini | 96.5 |
| Haiku 4.5 | 96.4 |
| Gemini 2.5 Pro Preview 05-06 | 95.9 |
| Gemini 2.5 Pro Preview 03-25 | 95.6 |
| GPT-5 Nano | 95.2 |
| O1 | 94.7 |
| DeepSeek-R1 | 93.1 |
| Claude 3.7 Sonnet | 91.2 |
| Grok 3 Mini | 90.9 |
| DeepSeek-R1-Distill-Llama-70B | 89.9 |
| o1-mini | 89.2 |
| Grok 3 | 88.7 |
| GPT-4.1 Mini | 87.3 |
| DeepSeek R1 Distill Qwen 14B | 87.1 |
| Opus 4 | 85.0 |
| Sonnet 4 | 84.4 |
| Gemini 2.0 Pro Experimental 02-05 | 83.5 |
| GPT-4.1 | 83.0 |
| Gemini 2.0 Flash 001 | 82.2 |
| o1 Preview | 81.6 |
| Mistral Medium 3 | 81.6 |
| GPT-4.5 | 78.6 |
| DeepSeek-V3-0324 | 75.5 |
| Gemma 3 27B IT | 74.0 |
| Llama 4 Maverick Instruct FP8 | 73.0 |
| Gemini 1.5 Pro 002 | 70.4 |
| GPT-4.1 Nano | 70.0 |
| Qwen3-235B-A22B | 68.9 |
| Qwen2.5-Max | 67.2 |
| Qwen-Plus (2025-01-25) | 65.3 |
| Phi-4 | 64.9 |
| DeepSeek-V3 | 64.9 |
| Grok 2 1212 | 63.5 |