Butter-Bench
Agents · 2025-10-23
Butter-Bench evaluates LLM-controlled robot orchestrators on practical real-world delivery tasks. The main score is average task completion rate across six physical robot subtasks.
Top models (higher is better)
| Model | Score |
|---|---|
| Human (Butter-Bench) | 95.0 |
| Gemini 2.5 Pro | 40.0 |
| Opus 4.1 | 37.0 |
| GPT-5 | 30.0 |
| Gemini Robotics-ER 1.5 | 27.0 |
| Grok 4 | 23.0 |
| Llama 4 Maverick | 7.0 |