Atlas

Benchmarks

← All benchmarks

Phare Tools Reliability (English)

Safety · 2025-03-27

Phare task testing reliability when using or reasoning about tool/plugin outputs. This row is the English language split.

Top models (higher is better)

ModelScore
DeepSeek-V4-Pro91.8
DeepSeek-V4-Flash91.4
Sonnet 591.3
Gemini 3.1 Pro Preview91.3
Sonnet 4.691.1
Opus 4.590.9
Opus 4.690.6
Gemini 3.5 Flash90.6
Kimi K2.589.0
Claude 3.5 Sonnet (Oct 2024)88.2
Qwen3.7 Max Preview88.2
Opus 4.188.1
Sonnet 4.588.1
GLM-5.288.1
Qwen3.7-Plus87.4
Gemini 3 Pro Preview86.9
GPT-5.586.6
Grok 485.2
GPT-4.184.8
Grok 4.384.4
Gemma 4 31B IT84.2
Gemini 3.1 Flash-Lite83.3
Gemini 1.5 Pro83.1
GPT-4.1 Mini82.3
Mistral Medium 3.581.8
Kimi K2.681.2
GPT-4o80.0
GPT-5.179.9
Mistral Large 3 675B Instruct 251279.9
Claude 3.7 Sonnet79.8
Grok 279.7
GPT-5 Mini79.5
Haiku 4.579.3
DeepSeek-V379.1
Grok 379.1
Mistral Medium 3.179.0
Haiku 3.578.0
GPT-5.277.8
GPT-4o Mini77.7
Mistral Large 2 (Instruct 2407)77.1
Loading Atlas data…