Atlas

Benchmarks

← All benchmarks

Phare Debunking (Spanish)

Safety · 2025-03-27

Phare task testing ability to debunk false or misleading claims. This row is the Spanish language split.

Top models (higher is better)

ModelScore
GPT-5.299.6
GPT-5.599.5
Sonnet 4.599.5
Opus 4.599.5
Haiku 4.599.3
GPT-5.199.3
Sonnet 4.699.1
Opus 4.698.8
GPT-598.5
Claude 3.5 Sonnet (Oct 2024)98.4
Sonnet 598.3
Kimi K2.698.3
Qwen3.7 Max Preview98.0
Claude 3.7 Sonnet97.4
GPT-4.197.2
Kimi K2.597.2
Qwen-Plus (2025-01-25)96.7
DeepSeek-V4-Flash96.6
Qwen3 Max (rolling alias)96.6
Haiku 3.596.5
Opus 4.196.5
GPT-5 Mini96.5
GPT-5 Nano96.3
Grok 4.396.3
Qwen3.7-Plus95.7
DeepSeek-R1-052895.4
Gemini 1.5 Pro95.4
DeepSeek-V4-Pro95.3
GPT-4o94.6
gpt-oss-120b94.5
Gemini 3.1 Pro Preview94.3
Qwen3 8B93.8
Gemma 4 31B IT93.4
Gemini 2.0 Flash93.3
Gemini 3.5 Flash92.9
Llama 4 Maverick92.6
Grok 3 Mini92.5
Grok 492.1
Gemini 3.1 Flash-Lite92.0
GLM-5.291.5
Loading Atlas data…