Atlas

Benchmarks

← All benchmarks

BBH (BIG-Bench Hard)

General QA · 2022-10-17

A curated subset of BIG-bench tasks that remain difficult for large language models, probing compositional, symbolic, and multi-step reasoning.

Top models (higher is better)

ModelScore
Claude 3.5 Sonnet (Oct 2024)93.2
Claude 3.5 Sonnet (June 2024)93.1
Gemini 1.5 Pro 00189.2
Opus 386.8
Haiku 3.586.6
Gemini 1.5 Flash85.5
Gemini 1.0 Ultra83.6
GPT-483.1
Llama 3.1 405B82.9
Claude 3 Sonnet82.9
Phi-3 Medium 128K Instruct81.4
Qwen2.5 72B79.8
Phi-3-Small-8K-Instruct79.1
DeepSeek-V278.8
PaLM 2-L77.7
GPT-4 061375.1
Gemini 1.0 Pro75.0
Claude 3 Haiku73.7
Phi-3-mini-4k-instruct71.7
Gemini 1.5 Flash-8B69.5
Stable Beluga 269.3
GPT-3.5 Turbo 061361.6
Phi-259.4
Nemotron-4 15B58.7
Gemma 7B55.1
Yi-34B54.3
Qwen 14B53.4
InternLM 20B52.5
Qwen 7B45.0
Llama 2 34B44.1
Vicuna 13B v1.143.0
Yi-6B42.8
Gemini Nano 242.4
MPT-30B38.0
Falcon 40B37.1
InternLM 7B37.0
Gemma 2B35.2
Gemini Nano 134.8
Baichuan-7B32.5
Qwen 1.8B28.2
Loading Atlas data…