Llama 3.2 11B Vision Instruct
Meta · 2024-09-25 · 10.7B parameters
Llama 3.2 11B Vision Instruct is Meta's instruction-tuned multimodal generation model, built on Llama 3.1 with an image encoder and cross-attention adapter layers. It accepts text and images and produces text for visual recognition, image reasoning, captioning, document visual question answering, and assistant-style chat.