Atlas

Models

← All models

Llama 3.2 11B Vision Instruct

Meta · 2024-09-25 · 10.7B parameters

Llama 3.2 11B Vision Instruct is Meta's instruction-tuned multimodal generation model, built on Llama 3.1 with an image encoder and cross-attention adapter layers. It accepts text and images and produces text for visual recognition, image reasoning, captioning, document visual question answering, and assistant-style chat.

Benchmark scores

BenchmarkScore
AA-LCR11.7
AA-Omniscience Index-63.1
AI2D (OpenVLM)77.3
AidanBench486
AIME 20251.7
Artificial Analysis Intelligence Index3.3
Artificial Analysis Omniscience Accuracy10.2
Artificial Analysis Omniscience Hallucination Rate81.6
Artificial Analysis Openness Index38.9
BALROG16.8
Capability107.2
CritPt0.0
EQ-Bench v267.9
GPQA Diamond22.1
HallusionBench (OpenVLM)40.3
Humanity's Last Exam (Text-Only)5.2
IFBench (Artificial Analysis)30.4
LiveCodeBench (Artificial Analysis)11.0
MATH-500 (Artificial Analysis source)51.6
MathVista (OpenVLM)47.7
MM-Vet (OpenVLM)57.6
MMLU56.5
MMLU Pro46.4
MMMU Pro29.3
MMMU Validation (OpenVLM)48.0
MMMU-Pro (Vals 4-Option)38.8
MMStar (OpenVLM)49.8
MortgageTax23.3
MortgageTax - Numerical Extraction21.4
MortgageTax - Semantic Extraction25.2
Loading Atlas data…