Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — Extraction, Judged (September)

Multimodal

Image data-extraction correctness judged against ground truth by Gemini 3.5 Flash at temperature zero. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
Gemini 3.8 Flash97.3
Gemini 3 Flash Preview96.9
Gemini 3.7 Flash96.2
Gemini 3.1 Pro Preview95.9
Gemini 3.6 Flash95.9
Gemini 3.5 Flash95.5
Claude Fable 5.193.5
Claude Opus 5.593.5
Gemini 3.5 Flash-Lite91.8
Claude Fable 591.8
GPT-6 Astra91.1
Sonnet 589.7
Claude Opus 589.7
Muse Spark 1.289.0
Muse Spark 1.189.0
Opus 4.888.7
Muse Spark 1.388.7
Qwen3-VL-235B-A22B-Instruct87.6
Grok 4.787.6
GPT-5.6 Sol86.9
GPT-5.586.9
Muse Glimmer 30B86.6
Grok 4.685.6
Qwen3.8 Flash84.9
Gemini 2.5 Pro84.5
Kimi K384.5
GPT-5.4 Mini84.2
Qwen3.7-Plus83.5
GLM-5.3 Flash83.5
Grok 4.583.5
GPT-6 Sol82.5
MiMo-V2.6-Flash82.5
GPT-5.6 Luna81.8
GLM 5V Turbo81.4
MiMo-V2.6-Pro81.1
GPT-5.6 Terra80.4
Qwen3.5-27B79.4
Kimi K2.679.4
Qwen3.7 Flash77.3
GPT-6 Luna68.0
Loading Atlas data…