Atlas

Benchmarks

← All benchmarks

Roboflow Vision Evals — OCR (September)

Multimodal

Mean similarity of OCR transcriptions to ground truth, preserving capitalization, symbols and layout. One or three runs per effort tier; atomic sample count unreported.

Top models (higher is better)

ModelScore
Claude Fable 594.0
Claude Fable 5.194.0
Opus 4.893.8
Muse Spark 1.293.6
Grok 4.793.5
Claude Opus 593.2
Kimi K393.0
Muse Spark 1.192.8
Gemini 3.1 Pro Preview92.6
Grok 4.592.3
Muse Glimmer 30B92.1
GPT-6 Astra91.9
GPT-6 Sol91.9
Grok 4.691.8
Sonnet 591.7
GPT-5.591.7
GPT-5.6 Luna91.5
Qwen3.8 Flash91.3
Muse Spark 1.391.3
MiMo-V2.6-Pro90.7
GPT-5.6 Sol90.7
GLM-5.3 Flash90.6
GPT-5.4 Mini89.5
Gemini 3.6 Flash89.5
GPT-5.6 Terra89.4
Gemini 3.5 Flash89.3
GLM 5V Turbo89.3
Gemini 3.7 Flash89.0
Gemini 3.8 Flash88.8
Gemini 2.5 Pro88.8
GPT-6 Luna88.5
Kimi K2.688.5
Qwen3-VL-235B-A22B-Instruct88.1
Claude Opus 5.587.8
Gemini 3 Flash Preview87.6
Gemini 3.5 Flash-Lite87.4
MiMo-V2.6-Flash87.0
Qwen3.7-Plus86.5
Qwen3.5-27B84.5
Qwen3.7 Flash84.1
Loading Atlas data…