Atlas

Benchmarks

← All benchmarks

OSWorld-Verified

Agents · 2025-07-28

Computer-use benchmark on a live Ubuntu VM, scored by binary task-completion success. Reporting protocols vary by source: some average repeated trials, while others report a single attempt or first-attempt success, so trial details belong in each observation's notes.

Top models (higher is better)

ModelScore
Claude Mythos Preview85.4
Claude Fable 585.0
Claude Mythos 585.0
Opus 4.783.6
Opus 4.883.4
Gemini 3.6 Flash83.0
Sonnet 4.681.5
Sonnet 581.2
Muse Spark 1.180.7
GPT-5.578.7
Gemini 3.5 Flash78.4
Gemini 3.1 Pro Preview78.3
MiniMax M375.2
GPT-5.475.0
Gemini 3.5 Flash-Lite74.0
Qwen3.7-Plus73.3
Kimi K2.673.1
Opus 4.672.7
GPT-5.6 Luna72.6
Opus 4.572.6
GPT-5.4 Mini72.1
GPT-569.9
Gemini 3 Flash Preview65.1
Kimi K2.563.3
Sonnet 4.562.9
Doubao Seed 1.861.9
Gemini 3.1 Flash-Lite54.3
Haiku 4.550.7
Gemini 2.5 Pro45.8
Sonnet 443.9
GPT-5 Mini42.0
GPT-5.4 Nano39.0
GPT-5.2-Codex38.2
Claude 3.7 Sonnet35.8
Computer Use Preview31.3
GPT-4o29.3
UI-TARS 72B DPO27.1
o323.0
Kimi-VL-A3B-Thinking10.3
Qwen2.5-VL-72B-Instruct5.0
Loading Atlas data…