Atlas

Benchmarks

← All benchmarks

LibraryDesignBench Pass Rate

Code

Task-weighted downstream implementer pass rate across LibraryDesignBench's 15 library-design tasks and 242 problems; three fixed implementer agents use each submitted library.

Top models (higher is better)

ModelScore
Claude Opus 5.586.6
Claude Fable 5.186.1
Kimi K386.0
GPT-6 Astra85.7
GPT-6 Sol85.2
Grok 4.684.5
GLM-5.384.1
GPT-5.6 Sol84.1
Loading Atlas data…