PostTrainBench Average
Indexes · 2026-03-09
PostTrainBench evaluates model post-training methods across its task suite. This row reports the benchmark's weighted-average percentage score.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 41.8 |
| Kimi K3 | 36.6 |
| GPT-5.6 Sol | 36.2 |
| GLM-5.2 | 34.3 |
| Opus 4.8 | 34.1 |
| Opus 4.7 | 28.6 |
| Grok 4.5 | 23.4 |
| Opus 4.6 | 23.2 |
| GPT-5.1-Codex-Max | 19.7 |
| Gemini 3 Pro Preview | 18.1 |
| GPT-5.3-Codex | 17.8 |
| Opus 4.5 | 17.3 |
| GPT-5.2-Codex | 17.2 |
| Sonnet 4.6 | 16.4 |
| GLM-5 | 13.9 |
| Kimi K2.5 | 10.3 |
| Sonnet 4.5 | 9.9 |
| MiniMax M2.5 | 9.5 |
| Kimi K2 Thinking | 7.3 |