BabyVision
Multimodal · 2026-01-10
BabyVision evaluates core visual abilities in multimodal large language models while minimizing reliance on language ability. It contains 388 questions spanning 22 subclasses in four visual domains and reports model accuracy.
Top models (higher is better)
| Model | Score |
|---|---|
| Doubao Seed 2.1 Pro | 73.7 |
| Doubao Seed 2.0 Pro | 60.6 |
| Gemini 3.1 Pro Preview | 51.6 |
| Gemini 3 Pro Preview | 49.7 |
| GPT-5.4 | 49.7 |
| Qwen3.5 397B A17B | 43.3 |
| Kimi K2.5 | 36.5 |
| GPT-5.2 | 34.4 |
| Doubao Seed 1.8 | 30.2 |
| Qwen3 VL 235B A22B Thinking | 22.2 |
| Qwen3-VL-Plus-2025-09-23 | 19.2 |
| GLM-4.6V | 17.6 |
| Grok 4 | 16.2 |
| Opus 4.6 | 14.8 |
| Opus 4.5 | 14.2 |