Atlas

Benchmarks

← All benchmarks

Phare Debunking

Safety · 2025-03-27

Phare task testing ability to debunk false or misleading claims.

Top models (higher is better)

ModelScore
Sonnet 4.599.6
GPT-5.299.6
Haiku 4.599.5
Opus 4.599.3
GPT-5.599.3
Opus 4.699.2
Sonnet 4.699.1
GPT-5.198.8
GPT-598.4
Kimi K2.698.1
Sonnet 597.9
Claude 3.5 Sonnet (Oct 2024)97.9
Claude 3.7 Sonnet97.1
Kimi K2.597.1
Qwen3 Max (rolling alias)96.9
Qwen3.7 Max Preview96.7
Gemini 1.5 Pro96.6
Opus 4.196.5
GPT-5 Nano96.5
Grok 4.396.4
Haiku 3.596.3
Qwen-Plus (2025-01-25)96.3
GPT-4.196.2
GPT-5 Mini96.2
DeepSeek-V4-Flash95.4
gpt-oss-120b95.0
Qwen3.7-Plus94.8
Qwen3 8B94.3
Gemini 3.1 Pro Preview94.2
DeepSeek-R1-052893.8
DeepSeek-V4-Pro93.8
GPT-4o93.2
Gemma 4 31B IT93.2
GLM-5.293.0
Gemini 2.0 Flash92.7
Gemini 3.1 Flash-Lite92.3
Llama 4 Maverick92.1
Gemini 3.5 Flash91.7
Grok 491.5
Grok 3 Mini91.0
Loading Atlas data…