Vals RSI — Parameter Golf
Agents · 2026-09-21
Reference-normalized score for one 12-hour offline research campaign on eight H100s. Final language-model artifact must fit 16 MB and train in ten minutes; rule review and three hidden-seed retrainings determine BPB. Baseline 1.2288 BPB, reference 1.0565, theoretical best 0.6.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Opus 5.5 | 41.4 |
| GPT-6 Astra | 40.6 |
| Claude Fable 5.1 | 37.0 |
| Claude Opus 5 | 33.4 |
| Claude Fable 5 | 30.6 |
| GLM-5.3 | 29.5 |
| Kimi K3 | 29.0 |
| Opus 4.7 | 26.7 |
| GPT-5.5 | 26.1 |
| Opus 4.8 | 25.6 |
| GPT-5.6 Sol | 25.6 |
| Muse Spark 1.3 | 19.8 |
| GPT-5.4 | 18.1 |
| GPT-5.2 | 14.9 |
| Gemini 3.8 Flash | 13.1 |
| Grok 4.6 | 11.9 |
| Kimi K2.5 | 0.0 |