Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Identification, Judged (September)

Multimodal

Visual entity identification judged against ground truth by Gemini 3.5 Flash at temperature zero. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
Claude Fable 5100.0
Gemini 3.1 Pro Preview100.0
Gemini 3.6 Flash100.0
Gemini 3.5 Flash99.0
Claude Fable 5.197.9
Gemini 3.8 Flash97.9
Gemini 3.7 Flash96.9
Claude Opus 5.595.8
Gemini 3 Flash Preview93.8
Gemini 2.5 Pro93.8
GPT-6 Astra92.7
GPT-5.6 Sol92.7
GPT-6 Sol92.7
Muse Spark 1.392.7
Muse Spark 1.191.7
Qwen3-VL-235B-A22B-Instruct90.6
Claude Opus 590.6
GPT-5.589.6
Muse Spark 1.289.6
Qwen3.8 Flash88.5
Grok 4.787.5
GPT-5.6 Terra86.5
Grok 4.585.4
Grok 4.685.4
Gemini 3.5 Flash-Lite84.4
Qwen3.7-Plus84.4
Opus 4.884.4
Qwen3.7 Flash84.4
GLM 5V Turbo84.4
GLM-5.3 Flash84.4
GPT-5.6 Luna84.4
GPT-5.4 Mini83.3
MiMo-V2.6-Flash82.3
Muse Glimmer 30B81.3
Sonnet 581.3
Kimi K381.3
GPT-6 Luna81.3
Qwen3.5-27B78.1
Kimi K2.678.1
MiMo-V2.6-Pro78.1
Loading Atlas data…