Atlas

Benchmarks

← All benchmarks

BabyVision

Multimodal · 2026-01-10

BabyVision evaluates core visual abilities in multimodal large language models while minimizing reliance on language ability. It contains 388 questions spanning 22 subclasses in four visual domains and reports model accuracy.

Top models (higher is better)

ModelScore
Doubao Seed 2.1 Pro73.7
Doubao Seed 2.0 Pro60.6
Gemini 3.1 Pro Preview51.6
Gemini 3 Pro Preview49.7
GPT-5.449.7
Qwen3.5 397B A17B43.3
Kimi K2.536.5
GPT-5.234.4
Doubao Seed 1.830.2
Qwen3 VL 235B A22B Thinking22.2
Qwen3-VL-Plus-2025-09-2319.2
GLM-4.6V17.6
Grok 416.2
Opus 4.614.8
Opus 4.514.2
Loading Atlas data…