Atlas

Benchmarks

← All benchmarks

Phare Misinformation

Safety · 2025-02-19

Phare task testing resistance to misinformation generation or endorsement.

Top models (higher is better)

ModelScore
Haiku 4.595.5
Claude 3.7 Sonnet89.5
Sonnet 4.586.2
Opus 4.585.8
Claude 3.5 Sonnet (Oct 2024)85.4
Opus 4.185.0
Sonnet 584.4
GPT-5 Nano80.0
Opus 4.679.6
Qwen-Plus (2025-01-25)77.9
GPT-5 Mini77.5
Magistral Medium 1.276.7
GPT-4.1 Nano76.6
Haiku 3.576.4
Gemini 3.1 Pro Preview76.0
Kimi K2.674.9
Gemini 1.5 Pro74.4
Llama 3.1 8B Instruct74.2
Llama 3.1 405B Instruct73.6
Sonnet 4.673.2
Gemini 2.5 Flash-Lite72.2
DeepSeek-V4-Flash69.9
Gemma 4 31B IT68.8
Mistral Large 2 (Instruct 2407)68.7
Gemini 2.5 Flash68.4
GPT-4o68.1
Command A67.7
GPT-5.167.7
Gemini 3.1 Flash-Lite67.0
Gemini 2.5 Pro65.2
Llama 4 Maverick65.0
Grok 464.8
Qwen3 Max (rolling alias)64.4
Llama 3.3 70B Instruct64.2
Grok 4.363.7
Qwen3.7 Max Preview63.5
Grok 3 Mini63.2
Gemini 2.0 Flash62.4
Gemini 3 Pro Preview62.1
Kimi K2.561.7
Loading Atlas data…