Atlas

Benchmarks

← All benchmarks

ARC-Challenge

Classic NLP · 2018-03-14

Hard science multiple-choice benchmark from AI2 Reasoning Challenge.

Top models (higher is better)

ModelScore
Opus 396.4
Claude 3 Sonnet93.2
Claude 3 Haiku89.2
Loading Atlas data…