Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Detection mAP@50:95 (September)

Multimodal

Mean average precision across IoU thresholds 0.50 to 0.95, under the September observed protocol. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
GPT-6 Astra61.9
Gemini 3.8 Flash59.0
Gemini 3.7 Flash58.9
Claude Opus 5.558.2
Gemini 3.6 Flash55.3
GPT-6 Sol54.8
Gemini 3.5 Flash54.4
Gemini 3.1 Pro Preview52.4
Qwen3.8 Flash51.9
GPT-6 Luna45.8
GPT-5.6 Sol45.2
Qwen3.7-Plus45.1
Qwen3.5-27B45.1
Gemini 3.5 Flash-Lite44.5
GPT-5.6 Luna42.6
Kimi K340.4
Qwen3-VL-235B-A22B-Instruct40.3
Claude Fable 5.139.6
GPT-5.6 Terra39.6
Muse Spark 1.239.5
Muse Spark 1.139.4
GLM 5V Turbo39.2
Muse Spark 1.335.8
MiMo-V2.6-Pro32.3
Claude Fable 531.4
MiMo-V2.6-Flash31.2
Qwen3.7 Flash31.1
Claude Opus 530.5
Gemini 3 Flash Preview27.9
Kimi K2.626.8
Gemini 2.5 Pro24.7
Grok 4.724.4
GPT-5.524.0
Muse Glimmer 30B23.0
GLM-5.3 Flash19.0
Sonnet 518.1
Opus 4.816.8
Grok 4.69.5
Grok 4.57.9
GPT-5.4 Mini5.9
Loading Atlas data…