Atlas

Benchmarks

← All benchmarks

Phare Debunking (English)

Safety · 2025-03-27

Phare task testing ability to debunk false or misleading claims. This row is the English language split.

Top models (higher is better)

ModelScore
GPT-5.299.9
Sonnet 4.599.7
Haiku 4.599.6
Opus 4.599.6
GPT-5.599.5
Opus 4.699.3
Sonnet 4.699.3
GPT-5.198.9
GPT-598.8
Kimi K2.698.5
Gemini 1.5 Pro98.1
Sonnet 597.9
GPT-5 Nano97.8
Qwen3 Max (rolling alias)97.6
Claude 3.5 Sonnet (Oct 2024)97.5
Kimi K2.597.3
Opus 4.197.1
Qwen3.7 Max Preview97.1
Claude 3.7 Sonnet97.1
Grok 4.396.7
Qwen-Plus (2025-01-25)96.7
GPT-5 Mini96.4
Haiku 3.596.2
GPT-4.196.0
gpt-oss-120b95.2
DeepSeek-V4-Flash94.4
Gemini 3.1 Flash-Lite94.3
Gemini 3.1 Pro Preview94.3
Qwen3 8B94.3
GLM-5.294.2
Gemma 4 31B IT93.6
Qwen3.7-Plus93.6
Llama 3.1 405B Instruct93.2
DeepSeek-V4-Pro92.7
Gemini 2.0 Flash92.7
Gemini 3.5 Flash92.4
Llama 4 Maverick92.4
DeepSeek-R1-052892.3
GPT-4o92.0
Grok 391.4
Loading Atlas data…