Atlas

Benchmarks

← All benchmarks

FrontierMath Tiers 1-3 (v2) - Private

Math · 2026-06-12

The Private split of FrontierMath Tiers 1-3 (v2). This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
GPT-5.6 Sol89.1
GPT-5.5 Pro87.7
Claude Fable 587.0
GPT-5.6 Terra86.0
Claude Opus 585.6
GPT-5.585.3
GPT-5.4 Pro82.5
GPT-5.6 Luna82.1
Opus 4.880.0
GPT-5.478.6
GPT-5.2 Pro74.0
Kimi K372.2
Opus 4.770.2
GPT-5.267.4
Opus 4.666.0
Sonnet 565.6
Qwen3.7-Max64.6
Gemini 3.5 Flash62.8
GLM-5.259.2
Gemini 3.6 Flash58.9
Grok 4.557.2
Kimi K2.657.2
GPT-5 Pro55.8
GPT-555.4
Kimi K2.7 Code54.0
Gemini 3 Flash Preview51.2
GPT-5.4 Mini51.2
GPT-5 Mini46.7
DeepSeek-V4-Pro45.3
GPT-5.4 Nano44.9
Grok 4.2044.9
Grok 4.342.8
O4 Mini36.1
Opus 4.534.4
Gemini 2.5 Pro24.6
Sonnet 4.523.9
GPT-5 Nano20.0
o3-mini18.6
Opus 4.112.6
Loading Atlas data…