Atlas

Benchmarks

← All benchmarks

Vals RSI — Post-training

Agents · 2026-09-21

Reference-normalized score for improving a provided Qwen3.6-35B-A3B checkpoint in 30 hours on sixteen RTX PRO 6000 GPUs, with internet, 27 public Finance Agent v2 examples and $100 external inference credits. One submitted checkpoint and generation setup is evaluated three times on 126 held-out tasks. Baseline 35.38%, reference 59.42%, theoretical best 99%.

Top models (higher is better)

ModelScore
Claude Opus 5.535.1
Claude Opus 531.8
Claude Fable 5.128.0
GPT-6 Astra7.8
Claude Fable 50.0
Opus 4.70.0
Opus 4.80.0
Gemini 3.8 Flash0.0
GLM-5.30.0
GPT-5.20.0
GPT-5.40.0
GPT-5.50.0
GPT-5.6 Sol0.0
Grok 4.60.0
Kimi K2.50.0
Kimi K30.0
Muse Spark 1.30.0
Loading Atlas data…