Atlas

Benchmarks

← All benchmarks

PostTrainBench Average

Indexes · 2026-03-09

PostTrainBench evaluates model post-training methods across its task suite. This row reports the benchmark's weighted-average percentage score.

Top models (higher is better)

ModelScore
Claude Fable 541.8
Kimi K336.6
GPT-5.6 Sol36.2
GLM-5.234.3
Opus 4.834.1
Opus 4.728.6
Grok 4.523.4
Opus 4.623.2
GPT-5.1-Codex-Max19.7
Gemini 3 Pro Preview18.1
GPT-5.3-Codex17.8
Opus 4.517.3
GPT-5.2-Codex17.2
Sonnet 4.616.4
GLM-513.9
Kimi K2.510.3
Sonnet 4.59.9
MiniMax M2.59.5
Kimi K2 Thinking7.3
Loading Atlas data…