Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals

Multimodal · 2026-07-22

Roboflow Vision Evals compares vision-language models on 513 real-image samples across object detection, counting, identification, OCR, data extraction, and visual reasoning. The headline score is the unweighted mean of the six task-level headline scores.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash87.1
Gemini 3.1 Pro Preview86.3
Gemini 3.6 Flash82.8
Claude Fable 582.2
Muse Spark 1.179.1
GPT-5.6 Sol78.3
Gemini 3 Flash Preview77.1
GPT-5.6 Luna76.8
GPT-5.576.4
GPT-5.6 Terra76.2
Gemini 3.5 Flash-Lite70.3
Gemini 2.5 Pro69.1
Sonnet 568.7
Opus 4.868.1
Qwen3-VL-235B-A22B-Instruct68.0
Qwen3.7-Plus68.0
Kimi K367.4
GPT-5.4 Mini67.3
GLM 5V Turbo67.2
Qwen3.5-27B66.2
Kimi K2.657.6
Loading Atlas data…