Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Reasoning, Strict (September)

Multimodal

Normalized exact-match visual reasoning accuracy, reported beside judged accuracy under the September observed protocol.

Top models (higher is better)

ModelScore
GPT-6 Astra89.6
Claude Opus 5.585.9
Gemini 3.8 Flash84.5
Gemini 3.7 Flash81.2
Gemini 3.5 Flash81.0
Gemini 3.6 Flash81.0
GPT-6 Sol76.8
Muse Spark 1.174.8
Gemini 3.1 Pro Preview74.8
Muse Spark 1.274.6
Gemini 3 Flash Preview74.2
Kimi K374.2
Muse Spark 1.373.3
GPT-5.572.2
GPT-5.6 Sol71.7
Qwen3.8 Flash69.5
Claude Opus 568.9
Gemini 3.5 Flash-Lite68.9
Grok 4.766.7
Qwen3.7-Plus66.2
Claude Fable 566.2
GPT-5.6 Luna65.6
GPT-5.6 Terra65.3
GPT-5.4 Mini64.0
Grok 4.663.8
Muse Glimmer 30B62.9
Gemini 2.5 Pro62.3
Qwen3.5-27B61.6
Qwen3.7 Flash60.9
GPT-6 Luna60.0
Grok 4.559.8
Kimi K2.657.6
MiMo-V2.6-Flash55.9
MiMo-V2.6-Pro54.1
GLM-5.3 Flash51.7
GLM 5V Turbo49.7
Opus 4.844.4
Sonnet 543.0
Claude Fable 5.136.2
Qwen3-VL-235B-A22B-Instruct33.8
Loading Atlas data…