Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Counting, Judged (September)

Multimodal

Object-counting correctness judged against ground truth by Gemini 3.5 Flash at temperature zero. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash82.4
Claude Opus 5.582.0
GPT-6 Astra81.1
Gemini 3.6 Flash80.2
Gemini 3.7 Flash79.3
Gemini 3.8 Flash79.3
Muse Spark 1.176.6
Muse Spark 1.276.6
GPT-5.6 Sol76.1
GPT-6 Sol76.1
Muse Spark 1.375.7
Claude Fable 5.173.0
Gemini 3.1 Pro Preview71.6
GPT-5.6 Luna70.7
Claude Opus 570.3
GPT-5.568.0
Qwen3.8 Flash68.0
Gemini 3 Flash Preview67.6
Muse Glimmer 30B66.2
GPT-5.6 Terra65.8
GPT-6 Luna65.8
Grok 4.665.8
GPT-5.4 Mini64.9
MiMo-V2.6-Flash64.9
Claude Fable 563.5
Grok 4.761.7
Grok 4.559.5
MiMo-V2.6-Pro59.0
Sonnet 556.8
Kimi K2.656.8
GLM-5.3 Flash55.4
Qwen3.5-27B54.0
Opus 4.854.0
Gemini 3.5 Flash-Lite52.7
Gemini 2.5 Pro52.7
Qwen3.7-Plus50.0
GLM 5V Turbo48.6
Qwen3-VL-235B-A22B-Instruct47.3
Qwen3.7 Flash46.0
Kimi K346.0
Loading Atlas data…