Atlas

Benchmarks

← All benchmarks

OSWorld 2.0

Agents · 2026-06-25

OSWorld 2.0 evaluates computer-use agents on 108 long-horizon real-world workflows spanning everyday and professional desktop/web tasks. The official leaderboard reports binary completion accuracy and partial score under fixed step budgets.

Top models (higher is better)

ModelScore
GPT-5.6 Sol62.6
GPT-5.6 Terra50.2
Opus 4.849.7
GPT-5.547.5
GPT-5.6 Luna45.6
Opus 4.718.2
Sonnet 4.69.3
MiniMax M34.6
Qwen3.7-Plus2.8
Loading Atlas data…