Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals - Visual Reasoning

Multimodal · 2026-07-22

The Roboflow Vision Evals visual-reasoning task measures exact-match accuracy on 23 image questions that require spatial or relational reasoning.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview91.3
Claude Fable 587.0
Gemini 3.5 Flash87.0
GPT-5.6 Luna87.0
GPT-5.582.6
GPT-5.6 Terra82.6
Gemini 3.6 Flash78.3
Gemini 3 Flash Preview78.3
GPT-5.4 Mini78.3
GPT-5.6 Sol73.9
Muse Spark 1.173.9
Opus 4.860.9
Gemini 2.5 Pro60.9
Sonnet 556.5
Gemini 3.5 Flash-Lite52.2
Kimi K347.8
GLM 5V Turbo43.5
Qwen3.5-27B43.5
Qwen3.7-Plus43.5
Qwen3-VL-235B-A22B-Instruct43.5
Kimi K2.630.4
Loading Atlas data…