Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Detection mAP@50 (September)

Multimodal

Mean average precision at IoU 0.50 for model-generated labeled bounding boxes. One or three runs per effort tier; three-run error bars are half-ranges, not standard errors. Current atomic sample count unreported.

Top models (higher is better)

ModelScore
GPT-6 Astra83.6
Claude Opus 5.576.8
GPT-6 Sol75.2
Gemini 3.8 Flash74.8
Gemini 3.7 Flash74.3
Gemini 3.6 Flash70.7
Gemini 3.5 Flash70.6
GPT-5.6 Sol68.4
Gemini 3.1 Pro Preview67.4
Qwen3.8 Flash67.0
Claude Fable 5.165.0
GPT-6 Luna64.1
GPT-5.6 Luna62.3
GPT-5.6 Terra61.3
Muse Spark 1.160.6
Muse Spark 1.260.5
Qwen3.7-Plus60.1
Qwen3.5-27B58.8
Muse Spark 1.358.6
Gemini 3.5 Flash-Lite57.5
GLM 5V Turbo56.5
Claude Fable 556.4
Claude Opus 554.4
Qwen3-VL-235B-A22B-Instruct52.1
Kimi K351.9
MiMo-V2.6-Pro46.7
MiMo-V2.6-Flash45.0
GPT-5.544.2
Qwen3.7 Flash42.8
Grok 4.741.2
Muse Glimmer 30B41.0
Gemini 3 Flash Preview38.6
Opus 4.838.6
Sonnet 536.1
Kimi K2.635.7
Gemini 2.5 Pro33.7
GLM-5.3 Flash33.1
Grok 4.624.0
Grok 4.519.0
GPT-5.4 Mini16.6
Loading Atlas data…