Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Detection mAP@75 (September)

Multimodal

Mean average precision at IoU 0.75, under the September observed protocol. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
GPT-6 Astra67.0
Gemini 3.8 Flash62.5
Gemini 3.7 Flash62.1
Claude Opus 5.561.0
Gemini 3.6 Flash58.1
GPT-6 Sol57.8
Gemini 3.5 Flash57.1
Gemini 3.1 Pro Preview55.8
Qwen3.8 Flash53.8
Qwen3.7-Plus48.4
GPT-6 Luna47.4
Gemini 3.5 Flash-Lite46.6
Qwen3.5-27B46.4
GPT-5.6 Sol46.1
GPT-5.6 Luna43.4
Qwen3-VL-235B-A22B-Instruct42.9
Muse Spark 1.242.1
Kimi K341.5
Muse Spark 1.140.9
GPT-5.6 Terra40.6
Claude Fable 5.140.4
GLM 5V Turbo39.9
Muse Spark 1.336.9
MiMo-V2.6-Pro32.9
Qwen3.7 Flash32.9
MiMo-V2.6-Flash32.3
Claude Fable 531.0
Claude Opus 530.2
Gemini 3 Flash Preview29.2
Kimi K2.626.7
Gemini 2.5 Pro25.1
GPT-5.524.0
Grok 4.723.7
Muse Glimmer 30B22.3
GLM-5.3 Flash17.9
Sonnet 515.8
Opus 4.813.3
Grok 4.66.1
Grok 4.55.0
GPT-5.4 Mini3.3
Loading Atlas data…