Atlas

Benchmarks

← All benchmarks

Vals RSI — Harness Engineering

Agents · 2026-09-21

Reference-normalized judge-harness research score after 12 hours. Agents improve a fixed Gemini 3.5 Flash-Lite judge using 12 development apps; frozen harness evaluated three times on 24 held-out apps with 205 substeps. Agreement baseline 50%, reference 95%, theoretical best 99%.

Top models (higher is better)

ModelScore
Claude Fable 5.116.4
Grok 4.615.7
GPT-5.6 Sol12.9
Claude Fable 512.6
GLM-5.312.0
Opus 4.811.4
Claude Opus 59.9
Claude Opus 5.59.6
Gemini 3.8 Flash9.6
Muse Spark 1.39.6
Kimi K36.0
GPT-6 Astra5.7
GPT-5.45.2
Opus 4.73.0
GPT-5.53.0
GPT-5.21.9
Kimi K2.50.9
Loading Atlas data…