Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Counting, Strict (September)

Multimodal

Strict object-counting correctness requires exactly one integer matching ground truth. Reported beside judged accuracy under the September observed protocol.

Top models (higher is better)

ModelScore
Gemini 3.5 Flash82.4
Claude Opus 5.581.1
GPT-6 Astra81.1
Gemini 3.6 Flash80.2
Gemini 3.7 Flash79.3
Gemini 3.8 Flash79.3
Muse Spark 1.176.6
Muse Spark 1.276.6
GPT-5.6 Sol76.1
GPT-6 Sol76.1
Muse Spark 1.374.8
Gemini 3.1 Pro Preview71.6
GPT-5.6 Luna70.7
Claude Opus 570.3
GPT-5.568.0
Qwen3.8 Flash68.0
Gemini 3 Flash Preview67.6
Muse Glimmer 30B66.2
GPT-5.6 Terra65.8
GPT-6 Luna65.8
Grok 4.665.8
GPT-5.4 Mini64.9
MiMo-V2.6-Flash64.4
Claude Fable 563.5
Grok 4.761.7
Grok 4.559.5
MiMo-V2.6-Pro58.1
Sonnet 556.8
GLM-5.3 Flash55.4
Qwen3.5-27B54.0
Opus 4.852.7
Gemini 3.5 Flash-Lite52.7
Gemini 2.5 Pro52.7
Kimi K2.650.0
Qwen3.7-Plus50.0
Claude Fable 5.148.6
GLM 5V Turbo48.6
Qwen3-VL-235B-A22B-Instruct47.3
Qwen3.7 Flash46.0
Kimi K346.0
Loading Atlas data…