Atlas

Benchmarks

← All benchmarks

Creative Writing v3 Elo

Chat & Writing · 2025-03-28

This Creative Writing v3 metric ranks model responses through pairwise judgments on creative-writing prompts. Scores are Elo ratings, with higher values indicating stronger writing.

Top models (higher is better)

ModelScore
Claude Opus 52430
Kimi K32340
GPT-5.6 Sol2092
Claude Fable 52065
Opus 4.72032
Muse Spark 1.12004
GPT-5.51908
GPT-5.6 Luna1899
Opus 4.81889
GPT-5.6 Terra1887
GPT-5.41886
Opus 4.61874
Sonnet 4.61873
Sonnet 51782
Sonnet 4.51732
o31728
GLM-5.21720
GPT-5.21718
Opus 4.51715
GPT-5.3 Instant1713
Kimi K2.61710
GPT-5.4 Mini1678
Kimi K2 Instruct1669
Kimi K2 Thinking1666
GPT-5 (2025-08-07)1648
Grok 4.201634
GLM-51626
Inkling1614
Horizon Alpha1613
GLM-5.11605
Grok 4.51581
Kimi K2.51577
Opus 41573
DeepSeek-V4-Pro1569
DeepSeek-V4-Flash1554
DeepSeek-R11500
Gemini 3 Pro Preview1491
DeepSeek-V3.21489
Mistral Medium 3.11485
MiMo-V2.5-Pro1482
Loading Atlas data…