VISTA
Multimodal · 2024-12-18
VISTA is Scale AI's rubric-based Visual Task Assessment benchmark for visual-language understanding, covering natural images and graphics with perception skills such as OCR, spatial understanding, and object recognition plus reasoning skills such as logic, calculation, and common sense.
Top models (higher is better)
| Model | Score |
|---|---|
| Gemini 2.5 Pro Preview 03-25 | 54.6 |
| Gemini 2.5 Pro Preview 06-05 | 54.6 |
| GPT-5.4 Pro | 53.9 |
| GPT-5 Pro | 52.4 |
| O4 Mini | 51.8 |
| o3-pro | 51.6 |
| Gemini 3 Pro Preview | 51.5 |
| GPT-5.4 | 50.9 |
| Gemini 2.5 Pro Preview 05-06 | 50.8 |
| GPT-5 Mini | 50.4 |
| o3 | 50.1 |
| GPT-5 | 49.7 |
| Gemini 2.5 Flash Preview 05-20 | 49.1 |
| Sonnet 4.5 | 48.8 |
| Opus 4.1 | 48.4 |
| Claude 3.7 Sonnet | 48.2 |
| O1 Pro | 47.3 |
| Gemini 2.5 Flash Preview 04-17 | 47.0 |
| Opus 4 | 47.0 |
| Gemini 3.1 Flash-Lite Preview | 46.9 |
| GPT-5.2 | 46.6 |
| Opus 4.5 | 46.4 |
| Opus 4.6 | 46.1 |
| Gemini 2.0 Flash Thinking Experimental 01-21 | 45.5 |
| Sonnet 4 | 45.5 |
| GPT-4.1 | 45.3 |
| O1 | 45.3 |
| GPT-5.1 | 43.8 |
| Gemini 2.0 Pro Experimental 02-05 | 43.3 |
| GPT-4.5 | 42.1 |
| Kimi K2.5 | 41.9 |
| GPT-4.1 Mini | 41.1 |
| Gemini 2.0 Flash Experimental | 40.0 |
| Gemini 2.0 Flash 001 | 39.9 |
| Claude 3.5 Sonnet (Oct 2024) | 38.7 |
| Claude 3.5 Sonnet (June 2024) | 38.4 |
| Llama 4 Maverick Instruct | 38.3 |
| GPT-4o (2024-11-20) | 38.0 |
| Gemini 1.5 Pro | 37.1 |
| GPT-4o (2024-08-06) | 34.9 |