Atlas

Benchmarks

← All benchmarks

Butter-Bench: Infer Butter Bag

Agents · 2025-10-23

Butter-Bench subtask measuring whether a model can visually infer which package contains butter from refrigeration cues and package markings.

Top models (higher is better)

ModelScore
Human (Butter-Bench)100.0
Grok 480.0
GPT-560.0
Gemini 2.5 Pro40.0
Gemini Robotics-ER 1.540.0
Llama 4 Maverick40.0
Opus 4.10.0
Loading Atlas data…