Atlas

Benchmarks

← All benchmarks

LLM Creative Story-Writing Benchmark

Chat & Writing · 2025-01-05

A short-fiction writing benchmark where models write constrained creative stories and are scored by pairwise story comparisons aggregated into a relative comparison score.

Top models (higher is better)

ModelScore
GPT-58.6
Kimi K2 Instruct8.6
Opus 4.18.5
o3-pro8.4
o38.4
Gemini 2.5 Pro8.4
Opus 48.4
GPT-5 Mini8.3
DeepSeek-R18.3
Qwen3-235B-A22B8.3
Qwen3 235B A22B Thinking 25078.2
DeepSeek-R1-05288.2
GPT-4o (2024-11-20)8.2
Sonnet 48.1
Claude 3.7 Sonnet8.1
Gemini 2.5 Pro Preview 05-068.1
Gemini 2.5 Pro Experimental 03-258.1
Claude 3.5 Sonnet (Oct 2024)8.0
QwQ-32B8.0
Gemma 3 27B IT8.0
Mistral Medium 37.7
gpt-oss-120b7.7
DeepSeek-V3-03247.7
Grok 47.7
Gemini 2.5 Flash Preview 04-177.7
Grok 37.6
GPT-4.57.6
Qwen3-30B-A3B7.5
O4 Mini7.5
Gemini 2.0 Flash Thinking Experimental 01-217.4
Haiku 3.57.3
Grok 3 Mini7.3
GLM-4.57.3
Qwen2.5-Max7.3
Gemini 2.0 Flash Experimental7.2
O17.0
GPT-4o Mini6.7
o1-mini6.5
Grok 2 12126.4
Phi-46.3
Loading Atlas data…