TriviaQA
Classic NLP · 2017-05-09
An open-domain question answering benchmark with challenging trivia questions paired with evidence documents.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude 2 | 87.5 |
| Claude 1.3 | 86.7 |
| PaLM 2-L | 86.1 |
| GPT-3.5 Turbo 1106 | 85.8 |
| GPT-4 0613 | 84.8 |
| DeepSeek-V3 | 82.9 |
| Llama 3.1 405B | 82.7 |
| Mixtral 8x7B | 82.2 |
| PaLM 2-M | 81.7 |
| DeepSeek-V2 | 80.0 |
| Claude Instant | 78.9 |
| Claude Instant 1.2 | 78.7 |
| PaLM 2-S | 75.2 |
| Phi-3 Medium 128K Instruct | 73.9 |
| Qwen2.5 72B | 71.9 |
| Llama 3 8B Instruct | 67.7 |
| Phi-3-mini-4k-instruct | 64.0 |
| Phi-3-Small-8K-Instruct | 58.1 |
| Gemma 2B | 53.2 |
| Phi-2 | 45.2 |