LibraryDesignBench Pass Rate
Code
Task-weighted downstream implementer pass rate across LibraryDesignBench's 15 library-design tasks and 242 problems; three fixed implementer agents use each submitted library.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Opus 5.5 | 86.6 |
| Claude Fable 5.1 | 86.1 |
| Kimi K3 | 86.0 |
| GPT-6 Astra | 85.7 |
| GPT-6 Sol | 85.2 |
| Grok 4.6 | 84.5 |
| GLM-5.3 | 84.1 |
| GPT-5.6 Sol | 84.1 |