FrontierMath Tier 4 (v2) - Private
Math · 2026-06-12
The Private split of FrontierMath Tier 4 (v2). This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 87.8 |
| GPT-5.6 Sol | 83.0 |
| GPT-5.6 Sol Pro | 80.5 |
| GPT-5.5 Pro | 78.0 |
| Claude Opus 5 | 73.2 |
| GPT-5.5 | 72.5 |
| GPT-5.6 Terra | 70.7 |
| GPT-5.6 Luna | 61.0 |
| GPT-5.4 Pro | 58.5 |
| Opus 4.8 | 56.1 |
| GPT-5.4 | 49.0 |
| GPT-5.2 Pro | 46.0 |
| Kimi K3 | 39.0 |
| Qwen3.7-Max | 34.1 |
| Opus 4.7 | 31.7 |
| GPT-5.2 | 31.7 |
| Sonnet 5 | 29.3 |
| GLM-5.2 | 29.3 |
| Opus 4.6 | 26.8 |
| Gemini 3.1 Pro Preview | 26.8 |
| Gemini 3.5 Flash | 26.8 |
| Kimi K2.6 | 25.6 |
| Grok 4.5 | 24.4 |
| Gemini 3.6 Flash | 22.0 |
| GPT-5 | 22.0 |
| GPT-5 Pro | 19.5 |
| Gemini 3 Flash Preview | 17.1 |
| Grok 4.20 | 17.1 |
| Grok 4.3 | 14.6 |
| GPT-5.4 Nano | 12.2 |
| GPT-5 Mini | 12.2 |
| Kimi K2.7 Code | 12.2 |
| GPT-5.4 Mini | 9.8 |
| Opus 4.5 | 4.9 |
| O4 Mini | 4.9 |
| Opus 4.1 | 2.4 |
| Sonnet 4.5 | 2.4 |
| DeepSeek-V4-Pro | 2.4 |
| GPT-5 Nano | 2.4 |
| Gemini 2.5 Pro | 0.0 |