Atlas

Benchmarks

← All benchmarks

Longform Creative Writing

Chat & Writing · 2025-05-23

Longform Creative Writing evaluates planning, revision, and an eight-turn short story or novella from a minimal prompt. Its current v1.11 results use Claude Sonnet 4.6 to report a 0–100 rubric score.

Top models (higher is better)

ModelScore
Claude Opus 586.3
Claude Fable 583.0
Opus 4.781.8
GPT-5.6 Sol81.7
Opus 4.880.8
Sonnet 4.679.9
Kimi K379.6
Kimi K2.678.5
Sonnet 578.3
GPT-5.478.3
GPT-5.578.2
GPT-5.6 Terra78.0
GLM-5.277.9
Opus 4.677.7
DeepSeek-V4-Pro75.6
GPT-5.6 Luna75.5
Kimi K2.574.9
MiMo-V2.5-Pro73.7
GLM-5.173.5
Opus 4.573.1
GPT-5 (2025-08-07)73.1
GPT-5.4 Mini73.0
Inkling72.5
Gemini 3.5 Flash71.8
GPT-5.271.6
Sonnet 4.571.4
Horizon Alpha71.2
GLM-570.9
MiMo-V2-Pro70.9
Muse Spark 1.170.6
Opus 4.170.5
Kimi K2 Thinking69.0
Gemini 3 Pro Preview68.8
Grok 4.2068.5
Qwen3.5 397B A17B68.3
Gemini 3.1 Pro Preview68.2
Kimi K2 Instruct68.1
DeepSeek-V3.266.8
GPT-5 Chat (2025-08-07)66.8
Qwen3-Max (2025-09-23)66.2
Loading Atlas data…