Atlas

Benchmarks

← All benchmarks

Phare Debunking (French)

Safety · 2025-03-27

Phare task testing ability to debunk false or misleading claims. This row is the French language split.

Top models (higher is better)

ModelScore
Sonnet 4.599.6
Haiku 4.599.5
Opus 4.699.4
GPT-5.299.2
GPT-5.599.0
Opus 4.599.0
Sonnet 4.698.9
GPT-5.198.0
GPT-597.8
Claude 3.5 Sonnet (Oct 2024)97.7
Sonnet 597.6
Kimi K2.697.3
Claude 3.7 Sonnet97.0
Kimi K2.596.7
Haiku 3.596.5
Qwen3 Max (rolling alias)96.5
Grok 4.396.3
Gemini 1.5 Pro96.2
Opus 4.196.1
GPT-5 Mini95.6
GPT-5 Nano95.6
Qwen-Plus (2025-01-25)95.6
GPT-4.195.3
gpt-oss-120b95.2
Qwen3.7-Plus95.2
DeepSeek-V4-Flash95.1
Qwen3.7 Max Preview94.9
Qwen3 8B94.9
Gemini 3.1 Pro Preview94.0
DeepSeek-R1-052893.8
DeepSeek-V4-Pro93.3
GLM-5.293.3
GPT-4o92.9
Gemma 4 31B IT92.4
Gemini 2.0 Flash92.0
Grok 391.1
Llama 4 Maverick91.1
Grok 491.0
Gemini 3.1 Flash-Lite90.5
Command A90.3
Loading Atlas data…