Atlas

Benchmarks

← All benchmarks

Phare Factuality

Safety · 2025-02-19

Phare task testing factual answer reliability and hallucination resistance.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview85.9
Gemini 3 Pro Preview83.3
GPT-5.583.2
Gemini 3.5 Flash82.4
GPT-5.178.2
GPT-578.2
Opus 4.677.9
Gemini 2.5 Pro77.6
GPT-5.277.6
Grok 476.8
Gemini 3.1 Flash-Lite75.4
GPT-4.174.8
Opus 4.574.7
Kimi K2.674.3
Sonnet 4.674.2
Grok 374.2
Kimi K2.573.7
Claude 3.5 Sonnet (Oct 2024)73.6
GLM-5.273.6
DeepSeek-V4-Pro73.1
Claude 3.7 Sonnet72.9
Qwen3.7 Max Preview72.7
Opus 4.172.0
Grok 4.371.8
GPT-4o71.1
Sonnet 4.570.0
DeepSeek-V4-Flash69.7
Sonnet 568.5
DeepSeek-R1-052868.4
Gemini 2.0 Flash68.3
DeepSeek-V3-032467.7
DeepSeek-V367.0
Gemini 1.5 Pro66.6
Mistral Large 3 675B Instruct 251266.4
Gemini 2.5 Flash66.3
Mistral Large 2 (Instruct 2407)65.0
Qwen3 Max (rolling alias)64.7
Mistral Medium 3.163.9
Qwen3.7-Plus63.7
Grok 3 Mini63.7
Loading Atlas data…