Atlas

Models

← All models

Molmo 7B-D

Allen Institute for AI (Ai2) · 2024-09-25 · 8B parameters

Molmo 7B-D-0924 is Ai2's September 2024 preview checkpoint for its Molmo 7B-D vision-language model, combining the open-weight Qwen2 7B language model with OpenAI CLIP ViT-L/14 336px as its vision encoder. It accepts text and images and produces text, including normalized 2D point coordinates for visual grounding and counting; Molmo's own weights, PixMo vision-language training data, training code, and evaluations are open, but the pretrained Qwen2 and CLIP components are not fully open-data.

Benchmark scores

BenchmarkScore
AA-LCR0.0
AI2D (OpenVLM)81.0
AIME 20250.0
Arena Vision — Chinese (No Style Control)885
Arena Vision — Chinese (Style Controlled)954
Arena Vision — English (No Style Control)1014
Arena Vision — English (Style Controlled)1036
Artificial Analysis Intelligence Index3.8
Artificial Analysis Openness Index88.9
Capability106.7
CharXiv Reasoning26.4
CharXiv-D52.7
GPQA Diamond24.0
HallusionBench (OpenVLM)46.4
Humanity's Last Exam (Text-Only)5.1
IFBench (Artificial Analysis)19.7
LiveCodeBench (Artificial Analysis)3.9
MathVista (OpenVLM)48.7
MM-Vet (OpenVLM)41.5
MMLU Pro37.1
MMMU Pro24.5
MMMU Validation (OpenVLM)49.1
MMStar (OpenVLM)56.1
SciCode (Artificial Analysis)3.6
Terminal-Bench Hard0.0
Vision Arena Overall994
Vision Arena Overall No Style Control959
τ²-bench (Telecom)0.0
Loading Atlas data…