Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Reasoning, Judged (September)

Multimodal

Visual reasoning correctness judged against ground truth by Gemini 3.5 Flash at temperature zero. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
GPT-6 Astra91.2
Claude Opus 5.585.9
Gemini 3.8 Flash84.5
Gemini 3.5 Flash82.1
Gemini 3.7 Flash81.9
Gemini 3.6 Flash81.0
GPT-6 Sol77.9
Muse Spark 1.176.6
Muse Spark 1.275.7
Gemini 3.1 Pro Preview74.8
Gemini 3 Flash Preview74.2
Claude Opus 574.2
Kimi K374.2
Muse Spark 1.373.3
Claude Fable 5.173.1
GPT-5.572.2
GPT-5.6 Sol71.7
Qwen3.8 Flash69.5
Gemini 3.5 Flash-Lite68.9
Qwen3.7-Plus68.2
Grok 4.766.9
Claude Fable 566.2
GPT-5.6 Luna65.6
GPT-5.6 Terra65.3
GPT-5.4 Mini64.0
Grok 4.663.8
Muse Glimmer 30B62.9
Gemini 2.5 Pro62.3
Qwen3.7 Flash61.6
Qwen3.5-27B61.6
GPT-6 Luna60.7
Grok 4.559.8
GLM-5.3 Flash59.6
Kimi K2.658.9
MiMo-V2.6-Flash58.5
MiMo-V2.6-Pro55.9
Opus 4.853.0
GLM 5V Turbo49.7
Sonnet 543.0
Qwen3-VL-235B-A22B-Instruct33.8
Loading Atlas data…