Atlas

Benchmarks

← All benchmarks

VISTA

Multimodal · 2024-12-18

VISTA is Scale AI's rubric-based Visual Task Assessment benchmark for visual-language understanding, covering natural images and graphics with perception skills such as OCR, spatial understanding, and object recognition plus reasoning skills such as logic, calculation, and common sense.

Top models (higher is better)

ModelScore
Gemini 2.5 Pro Preview 03-2554.6
Gemini 2.5 Pro Preview 06-0554.6
GPT-5.4 Pro53.9
GPT-5 Pro52.4
O4 Mini51.8
o3-pro51.6
Gemini 3 Pro Preview51.5
GPT-5.450.9
Gemini 2.5 Pro Preview 05-0650.8
GPT-5 Mini50.4
o350.1
GPT-549.7
Gemini 2.5 Flash Preview 05-2049.1
Sonnet 4.548.8
Opus 4.148.4
Claude 3.7 Sonnet48.2
O1 Pro47.3
Gemini 2.5 Flash Preview 04-1747.0
Opus 447.0
Gemini 3.1 Flash-Lite Preview46.9
GPT-5.246.6
Opus 4.546.4
Opus 4.646.1
Gemini 2.0 Flash Thinking Experimental 01-2145.5
Sonnet 445.5
GPT-4.145.3
O145.3
GPT-5.143.8
Gemini 2.0 Pro Experimental 02-0543.3
GPT-4.542.1
Kimi K2.541.9
GPT-4.1 Mini41.1
Gemini 2.0 Flash Experimental40.0
Gemini 2.0 Flash 00139.9
Claude 3.5 Sonnet (Oct 2024)38.7
Claude 3.5 Sonnet (June 2024)38.4
Llama 4 Maverick Instruct38.3
GPT-4o (2024-11-20)38.0
Gemini 1.5 Pro37.1
GPT-4o (2024-08-06)34.9
Loading Atlas data…