OSWorld (self-reported, Set-of-Mark)
Agents · 2024-04-11
Self-reported OSWorld success rate with Set-of-Mark observation.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-4o | 24.5 |
| GPT-4 Turbo with Vision | 11.8 |
| GPT-4 Turbo | 8.4 |
| Gemini 1.5 Pro | 7.8 |
| Opus 3 | 6.7 |
| Qwen VL Max 0809 | 5.4 |
| GPT-4o Mini | 3.5 |
| LLaVA-OneVision 72B | 2.4 |
| Gemini 1.0 Pro Vision | 1.1 |
| CogAgent | 1.0 |