Roboflow Vision Evals — Detection mAP@50 (September)
Multimodal
Mean average precision at IoU 0.50 for model-generated labeled bounding boxes. One or three runs per effort tier; three-run error bars are half-ranges, not standard errors. Current atomic sample count unreported.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-6 Astra | 83.6 |
| Claude Opus 5.5 | 76.8 |
| GPT-6 Sol | 75.2 |
| Gemini 3.8 Flash | 74.8 |
| Gemini 3.7 Flash | 74.3 |
| Gemini 3.6 Flash | 70.7 |
| Gemini 3.5 Flash | 70.6 |
| GPT-5.6 Sol | 68.4 |
| Gemini 3.1 Pro Preview | 67.4 |
| Qwen3.8 Flash | 67.0 |
| Claude Fable 5.1 | 65.0 |
| GPT-6 Luna | 64.1 |
| GPT-5.6 Luna | 62.3 |
| GPT-5.6 Terra | 61.3 |
| Muse Spark 1.1 | 60.6 |
| Muse Spark 1.2 | 60.5 |
| Qwen3.7-Plus | 60.1 |
| Qwen3.5-27B | 58.8 |
| Muse Spark 1.3 | 58.6 |
| Gemini 3.5 Flash-Lite | 57.5 |
| GLM 5V Turbo | 56.5 |
| Claude Fable 5 | 56.4 |
| Claude Opus 5 | 54.4 |
| Qwen3-VL-235B-A22B-Instruct | 52.1 |
| Kimi K3 | 51.9 |
| MiMo-V2.6-Pro | 46.7 |
| MiMo-V2.6-Flash | 45.0 |
| GPT-5.5 | 44.2 |
| Qwen3.7 Flash | 42.8 |
| Grok 4.7 | 41.2 |
| Muse Glimmer 30B | 41.0 |
| Gemini 3 Flash Preview | 38.6 |
| Opus 4.8 | 38.6 |
| Sonnet 5 | 36.1 |
| Kimi K2.6 | 35.7 |
| Gemini 2.5 Pro | 33.7 |
| GLM-5.3 Flash | 33.1 |
| Grok 4.6 | 24.0 |
| Grok 4.5 | 19.0 |
| GPT-5.4 Mini | 16.6 |