Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Identification, Strict (September)

Multimodal

Normalized exact-match visual identification accuracy, reported beside judged accuracy under the September observed protocol.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview100.0
Gemini 3.6 Flash99.0
Gemini 3.5 Flash99.0
Claude Fable 596.9
Gemini 3.8 Flash95.8
Gemini 3.7 Flash95.8
Claude Fable 5.193.8
Muse Spark 1.392.7
Gemini 3 Flash Preview90.6
Qwen3-VL-235B-A22B-Instruct90.6
Muse Spark 1.189.6
Muse Spark 1.289.6
Claude Opus 5.587.5
Gemini 2.5 Pro87.5
GPT-6 Sol87.5
GPT-6 Astra86.5
GPT-5.6 Sol86.5
GPT-5.586.5
Claude Opus 584.4
Qwen3.7-Plus84.4
Qwen3.7 Flash84.4
GLM 5V Turbo84.4
Qwen3.8 Flash83.3
Grok 4.781.3
Grok 4.681.3
Gemini 3.5 Flash-Lite81.3
MiMo-V2.6-Flash81.3
Sonnet 581.3
Kimi K381.3
GPT-5.6 Terra80.2
Grok 4.580.2
GPT-5.4 Mini79.2
GLM-5.3 Flash78.1
Muse Glimmer 30B78.1
Qwen3.5-27B78.1
GPT-5.6 Luna77.1
GPT-6 Luna76.0
MiMo-V2.6-Pro76.0
Opus 4.875.0
Kimi K2.662.5
Loading Atlas data…