Atlas

Benchmarks

← All benchmarks

Phare LLM Benchmark

Safety · 2025-02-19

Phare is a multilingual safety, security, and reliability benchmark from Giskard. It evaluates hallucination resistance, harm resistance, bias resistance, jailbreak resistance, and related task-level scores across English, Spanish, and French.

Top models (higher is better)

ModelScore
Haiku 4.583.2
Opus 4.582.4
Sonnet 578.1
Sonnet 4.577.6
Opus 4.176.9
Llama 3.1 405B Instruct76.4
Kimi K2.676.1
Qwen3.7 Max Preview75.6
Opus 4.674.1
Qwen3.7-Plus74.1
Sonnet 4.674.0
Gemini 3 Pro Preview73.3
GPT-5 Mini73.2
GPT-5.172.8
GPT-5.271.0
Llama 4 Maverick70.8
GPT-4o70.7
Gemini 3.1 Pro Preview70.6
GPT-5.570.5
GPT-4.1 Mini70.5
GLM-5.269.9
GPT-5 Nano69.5
Claude 3.7 Sonnet69.5
Haiku 3.569.1
Qwen-Plus (2025-01-25)68.8
Grok 4.368.6
Gemini 3.1 Flash-Lite67.5
Gemma 4 31B IT67.4
GPT-567.2
GPT-4.167.1
Kimi K2.567.0
Grok 4 Fast66.5
gpt-oss-120b66.1
Qwen3 Max (rolling alias)65.9
DeepSeek-V3.164.8
Mistral Small 3.2 24B Instruct 250664.5
Mistral Medium 3.564.3
Gemini 2.0 Flash64.2
Qwen3 8B63.9
Llama 4 Scout63.8
Loading Atlas data…