Atlas

Benchmarks

← All benchmarks

Antidote: Everyday Edition

Safety · 2026-05-21

Elo rating on real-world everyday prompts graded by experts.

Top models (higher is better)

ModelScore
Claude Fable 51113
Gemini 3.6 Flash1087
Gemini 3.1 Pro Preview1086
Gemini 3.5 Flash1082
Kimi K31075
Qwen3.7-Max1051
Claude Opus 51049
GLM-5.21045
Opus 4.71041
Kimi K2.61040
Opus 4.61039
Opus 4.81036
GPT-5.6 Sol1021
Muse Spark 1.11017
Sonnet 4.61013
GPT-5.51009
Kimi K2.51005
DeepSeek-V4-Pro1004
Grok 4.201000
Qwen3.5 Plus (2026-02-15)998
Gemini 3.5 Flash-Lite997
Inkling987
Grok 4.5977
DeepSeek-V4-Flash968
DeepSeek-V3.2954
Grok 4.3953
Mistral Large 3 675B Instruct 2512947
ERNIE 5.1946
Haiku 4.5937
GPT-5.4 Mini934
Gemma 3 12B PT897
ERNIE 4.5 300B A47B866
Nova 2 Pro (Preview)824
Loading Atlas data…