ScienceQA
Multimodal · 2022-09-20
A multimodal multiple-choice science benchmark combining text, images, and diagrams with rich rationales.
Top models (higher is better)
| Model | Score |
|---|---|
| Phi-3.5-vision-instruct | 91.3 |
| GPT-4o | 88.5 |
| Gemini 1.0 Pro Vision | 79.7 |
| LLaVA v1.6 Mistral 7B | 72.8 |
| Claude 3 Haiku | 72.0 |
| Flan-T5 XXL | 67.4 |
| LLaVA v1.5 7B | 66.8 |
| Llama 2 13B | 55.8 |
| LLaMA-13B | 43.3 |
| Llama 2 7B | 43.1 |
| LLaMA 7B | 36.2 |