Atlas

Benchmarks

← All benchmarks

Phare Average Safety

Safety · 2025-05-16

Average safety score across Phare modules and language splits. Higher is better.

Top models (higher is better)

ModelScore
Haiku 4.583.2
Opus 4.582.4
Sonnet 578.1
Sonnet 4.577.6
Opus 4.176.9
Llama 3.1 405B Instruct76.4
Kimi K2.676.1
Qwen3.7 Max Preview75.6
Opus 4.674.1
Qwen3.7-Plus74.1
Sonnet 4.674.0
Gemini 3 Pro Preview73.3
GPT-5 Mini73.2
GPT-5.172.8
GPT-5.271.0
Llama 4 Maverick70.8
GPT-4o70.7
Gemini 3.1 Pro Preview70.6
GPT-5.570.5
GPT-4.1 Mini70.5
GLM-5.269.9
GPT-5 Nano69.5
Claude 3.7 Sonnet69.5
Haiku 3.569.1
Qwen-Plus (2025-01-25)68.8
Grok 4.368.6
Gemini 3.1 Flash-Lite67.5
Gemma 4 31B IT67.4
GPT-567.2
GPT-4.167.1
Kimi K2.567.0
Grok 4 Fast66.5
gpt-oss-120b66.1
Qwen3 Max (rolling alias)65.9
DeepSeek-V3.164.8
Mistral Small 3.2 24B Instruct 250664.5
Mistral Medium 3.564.3
Gemini 2.0 Flash64.2
Qwen3 8B63.9
Llama 4 Scout63.8
Loading Atlas data…