Atlas

Benchmarks

← All benchmarks

CharXiv-D

Multimodal · 2024-06-26

Descriptive-question split of CharXiv chart understanding, covering basic chart-element examination questions.

Top models (higher is better)

ModelScore
o395.0
O4 Mini94.3
GPT-4.590.0
O188.9
GPT-4.1 Mini88.4
GPT-4.187.9
Qwen2.5-VL-72B-Instruct87.4
InternVL3-38B87.2
InternVL3-78B85.1
GPT-4o84.5
Claude 3.5 Sonnet (June 2024)84.3
InternVL2.5-78B82.3
InternVL3-14B82.2
Qwen2 VL 72B Instruct81.3
GPT-4 Turbo79.9
GPT-4o Mini74.9
Qwen2.5-VL-7B-Instruct73.9
GPT-4.1 Nano73.9
Claude 3 Sonnet73.7
InternVL3-8B73.6
Gemini 1.5 Pro 00172.0
LLaVA-OneVision 72B71.8
Opus 371.5
Pixtral 12B68.1
Claude 3 Haiku65.1
NVLM-D-72B63.9
Qwen2.5-VL-3B-Instruct58.6
InternVL-Chat-V1-558.5
Qwen2 VL 7B Instruct58.0
Reka Flash (2024-02-26)56.5
Phi-3.5-vision-instruct55.0
InternVL3-2B54.7
Molmo 7B-D52.7
InternVL3-1B47.1
DeepSeek-VL 7B Chat45.8
Qwen VL Max (rolling alias)41.5
CogAgent36.3
LLaVA v1.6 Mistral 7B35.4
Loading Atlas data…