Atlas

Benchmarks

← All benchmarks

Butter-Bench

Agents · 2025-10-23

Butter-Bench evaluates LLM-controlled robot orchestrators on practical real-world delivery tasks. The main score is average task completion rate across six physical robot subtasks.

Top models (higher is better)

ModelScore
Human (Butter-Bench)95.0
Gemini 2.5 Pro40.0
Opus 4.137.0
GPT-530.0
Gemini Robotics-ER 1.527.0
Grok 423.0
Llama 4 Maverick7.0
Loading Atlas data…