Atlas

Benchmarks

← All benchmarks

LLM Creative Story Writing Win Probability

Chat & Writing · 2025-01-05

Secondary metric from Lech Mazur's Creative Story-Writing benchmark, reporting each model's estimated win probability against the evaluated pool as a 0-1 probability.

Top models (higher is better)

ModelScore
Claude Fable 50.9
GPT-5.50.9
GPT-5.6 Sol0.9
GPT-5.40.9
Opus 4.70.8
Sonnet 4.60.8
Opus 4.60.8
Opus 4.80.7
Muse Spark 1.10.7
GPT-5.20.7
GLM-5.20.6
Kimi K2.60.6
MiniMax M30.6
Mistral Medium 3.10.5
DeepSeek-V4-Pro0.5
MiMo-V2.5-Pro0.5
Qwen3 Max (rolling alias)0.5
Qwen3.6-Max-Preview0.5
GLM-5.10.4
Kimi K2.50.4
ERNIE 5.10.4
MiMo-V2-Pro0.4
Mistral Large 3 675B Instruct 25120.3
Gemma 4 31B IT0.3
Gemini 3.5 Flash0.3
Doubao Seed 2.0 Pro0.3
Gemini 3.1 Pro Preview0.3
Qwen3.6 Plus (2026-04-02)0.3
Mistral Medium 3.50.2
Qwen3.7-Max0.2
DeepSeek-V3.20.2
gpt-oss-120b0.1
MiniMax M2.70.1
Grok 4.30.1
Grok 4.50.0
Loading Atlas data…