Atlas

Benchmarks

← All benchmarks

Vals RSI (four tasks) — Post-training

Agents

Reference-normalized improvement of a provided Qwen3.6-35B-A3B checkpoint in 30 hours on sixteen RTX PRO 6000 GPUs, with internet, 27 public Finance Agent v2 examples and $100 external inference credits. One submitted checkpoint and generation setup is evaluated three times on 126 held-out tasks. Baseline 35.38%, reference 59.42%, theoretical best 99%. Component of the four-task RSI revision.

Top models (higher is better)

ModelScore
Claude Opus 5.535.1
Claude Opus 531.8
Claude Fable 5.128.0
GPT-6 Sol16.3
GPT-6 Astra7.8
Claude Fable 50.0
Opus 4.70.0
Opus 4.80.0
Gemini 3.7 Flash0.0
Gemini 3.8 Flash0.0
GLM-5.30.0
GPT-5.20.0
GPT-5.40.0
GPT-5.50.0
GPT-5.6 Sol0.0
Grok 4.60.0
Grok 4.70.0
Kimi K2.50.0
Kimi K30.0
Muse Spark 1.30.0
Loading Atlas data…