Atlas

Benchmarks

← All benchmarks

Phare Tools Reliability

Safety · 2025-03-27

Phare task testing reliability when using or reasoning about tool/plugin outputs.

Top models (higher is better)

ModelScore
Sonnet 4.695.5
Opus 4.694.3
Gemini 3.1 Pro Preview94.2
DeepSeek-V4-Pro93.9
Sonnet 593.6
Gemini 3.5 Flash93.3
Opus 4.593.1
DeepSeek-V4-Flash92.5
Sonnet 4.592.2
GLM-5.291.9
Qwen3.7 Max Preview91.6
Opus 4.191.2
Kimi K2.590.3
Claude 3.5 Sonnet (Oct 2024)89.9
Grok 489.8
Qwen3.7-Plus89.7
GPT-5.589.2
Gemini 3 Pro Preview89.1
Gemma 4 31B IT87.7
Gemini 3.1 Flash-Lite87.6
Grok 4.385.9
Haiku 4.584.8
GPT-4.184.5
Mistral Medium 3.584.4
Kimi K2.683.9
Grok 383.2
GPT-5.182.8
Mistral Large 3 675B Instruct 251282.6
Haiku 3.582.6
Mistral Large 2 (Instruct 2407)82.5
Mistral Medium 3.182.4
GPT-4.1 Mini82.1
GPT-4o81.7
GPT-5 Mini81.6
Claude 3.7 Sonnet81.2
Grok 281.0
GPT-5.280.8
DeepSeek-V380.2
GPT-4o Mini79.8
gpt-oss-120b79.3
Loading Atlas data…