ARC-Challenge
Classic NLP · 2018-03-14
Hard science multiple-choice benchmark from AI2 Reasoning Challenge.
Top models (higher is better)
| Model | Score |
|---|---|
| Opus 3 | 96.4 |
| Claude 3 Sonnet | 93.2 |
| Claude 3 Haiku | 89.2 |
Classic NLP · 2018-03-14
Hard science multiple-choice benchmark from AI2 Reasoning Challenge.
| Model | Score |
|---|---|
| Opus 3 | 96.4 |
| Claude 3 Sonnet | 93.2 |
| Claude 3 Haiku | 89.2 |