Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Extraction, Strict (September)

Multimodal

Normalized exact-match image data-extraction accuracy, reported beside judged accuracy under the September observed protocol.

Top models (higher is better)

ModelScore
Gemini 3 Flash Preview95.9
Gemini 3.7 Flash95.5
Gemini 3.8 Flash95.2
Gemini 3.1 Pro Preview94.8
Gemini 3.6 Flash94.5
Gemini 3.5 Flash94.5
Claude Fable 5.192.1
Claude Opus 5.592.1
Claude Fable 591.8
Gemini 3.5 Flash-Lite90.7
GPT-6 Astra90.0
Sonnet 588.7
Claude Opus 588.7
Muse Spark 1.288.7
Muse Spark 1.188.3
Opus 4.887.6
Muse Spark 1.387.6
Grok 4.787.6
Qwen3-VL-235B-A22B-Instruct86.6
GPT-5.6 Sol85.9
GPT-5.585.9
Muse Glimmer 30B85.6
Grok 4.684.5
Kimi K384.5
Qwen3.8 Flash84.2
Gemini 2.5 Pro83.5
GPT-5.4 Mini83.2
Grok 4.582.8
Qwen3.7-Plus82.5
GLM-5.3 Flash81.4
GPT-6 Sol81.4
MiMo-V2.6-Flash81.4
GPT-5.6 Luna80.8
MiMo-V2.6-Pro79.7
GLM 5V Turbo79.4
GPT-5.6 Terra79.4
Qwen3.5-27B78.3
Kimi K2.678.3
Qwen3.7 Flash78.3
GPT-6 Luna67.0
Loading Atlas data…