Atlas

Benchmarks

← All benchmarks

FrontierMath Tier 4 (v2) - Private

Math · 2026-06-12

The Private split of FrontierMath Tier 4 (v2). This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Claude Fable 587.8
GPT-5.6 Sol83.0
GPT-5.6 Sol Pro80.5
GPT-5.5 Pro78.0
Claude Opus 573.2
GPT-5.572.5
GPT-5.6 Terra70.7
GPT-5.6 Luna61.0
GPT-5.4 Pro58.5
Opus 4.856.1
GPT-5.449.0
GPT-5.2 Pro46.0
Kimi K339.0
Qwen3.7-Max34.1
Opus 4.731.7
GPT-5.231.7
Sonnet 529.3
GLM-5.229.3
Opus 4.626.8
Gemini 3.1 Pro Preview26.8
Gemini 3.5 Flash26.8
Kimi K2.625.6
Grok 4.524.4
Gemini 3.6 Flash22.0
GPT-522.0
GPT-5 Pro19.5
Gemini 3 Flash Preview17.1
Grok 4.2017.1
Grok 4.314.6
GPT-5.4 Nano12.2
GPT-5 Mini12.2
Kimi K2.7 Code12.2
GPT-5.4 Mini9.8
Opus 4.54.9
O4 Mini4.9
Opus 4.12.4
Sonnet 4.52.4
DeepSeek-V4-Pro2.4
GPT-5 Nano2.4
Gemini 2.5 Pro0.0
Loading Atlas data…