Atlas

Benchmarks

← All benchmarks

BBH (BIG-Bench Hard)

General QA · 2022-10-17

A curated subset of BIG-bench tasks that remain difficult for large language models, probing compositional, symbolic, and multi-step reasoning.

Top models (higher is better)

ModelScore
Claude 3.5 Sonnet (Oct 2024)93.2
Claude 3.5 Sonnet (June 2024)93.1
Gemini 1.5 Pro89.2
Opus 386.8
Haiku 3.586.6
Gemini 1.5 Flash85.5
Gemini 1.0 Ultra83.6
GPT-483.1
Claude 3 Sonnet82.9
PaLM 2-L77.7
Gemini 1.0 Pro75.0
Claude 3 Haiku73.7
Gemini 1.5 Flash-8B69.5
Gemini Nano 242.4
Gemini Nano 134.8
Loading Atlas data…