Atlas

Benchmarks

← All benchmarks

BoolQ

Classic NLP · 2019-05-24

A yes/no reading comprehension benchmark where models answer naturally occurring questions given a short supporting passage.

Top models (higher is better)

ModelScore
PaLM 2-L90.9
T5 3B89.9
Inflection-189.7
Stable Beluga 289.4
GPT-4o Mini88.7
PaLM 2-M88.6
PaLM 2-S88.1
InternLM 20B87.5
GPT-3.5 Turbo 061387.0
Qwen 14B86.2
Gemini 1.5 Flash85.8
Gemma 2 9B85.7
PaLM 62B84.8
Phi-3.5-MoE-instruct84.6
Chinchilla83.7
Llama 2 34B83.7
Vicuna 13B v1.183.5
Gemma 7B83.2
Mistral 7B Instruct v0.283.2
Llama 3.1 8B Instruct82.8
Mistral NeMo Base 240782.5
Vicuna 13B v1.380.8
OPT-175B79.3
Gemini Nano 279.3
ChatGLM2 6B (chat)79.0
GLM-130B78.4
Phi-3.5 Mini Instruct78.0
Qwen 7B76.4
Phi-1.575.8
XGen-7B-8K-Base74.3
GPT-3.5 Turbo 030174.0
GPT-3 Davinci72.2
Gemini Nano 171.6
OpenLLaMA 7B70.6
Gemma 2B69.4
RedPajama INCITE 7B Base69.3
Qwen 1.8B68.0
Baichuan2-13B-Base67.0
GPT-3 Curie65.6
InternLM 7B64.1
Loading Atlas data…