Atlas

Benchmarks

← All benchmarks

Vals RSI — LM Training

Agents · 2026-09-21

Reference-normalized score for a GPT training program researched offline for 24 hours and 24 H100-hours on enwik9. Submitted code is retrained on three hidden seeds; median BPB over 32,768 hidden windows. Baseline 1.3699 BPB, reference 0.85, theoretical best 0.6.

Top models (higher is better)

ModelScore
Claude Opus 5.553.0
Claude Fable 5.149.5
GPT-6 Astra48.4
Claude Opus 542.8
Grok 4.642.3
Muse Spark 1.340.9
Claude Fable 540.8
Opus 4.840.8
GLM-5.340.8
Kimi K340.4
Opus 4.739.3
Gemini 3.8 Flash36.2
GPT-5.6 Sol36.1
GPT-5.531.1
GPT-5.230.6
GPT-5.428.0
Kimi K2.525.3
Loading Atlas data…