Creative Writing v3 Rubric Score
Chat & Writing · 2025-03-28
This Creative Writing v3 metric grades responses against the benchmark's 20-point writing rubric. Higher point totals indicate stronger creative-writing performance.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Opus 5 | 17.1 |
| GPT-5.5 | 17.0 |
| GPT-5.4 | 16.9 |
| Kimi K3 | 16.9 |
| Claude Fable 5 | 16.8 |
| GPT-5 (2025-08-07) | 16.8 |
| GPT-5.6 Sol | 16.8 |
| Horizon Alpha | 16.7 |
| Kimi K2.6 | 16.7 |
| Opus 4.8 | 16.7 |
| GPT-5.2 | 16.7 |
| GPT-5.6 Luna | 16.6 |
| Opus 4.7 | 16.6 |
| GPT-5.6 Terra | 16.6 |
| Muse Spark 1.1 | 16.5 |
| Opus 4.6 | 16.5 |
| GPT-5.4 Mini | 16.5 |
| Sonnet 4.6 | 16.5 |
| Sonnet 5 | 16.5 |
| Kimi K2 Thinking | 16.5 |
| DeepSeek-V4-Pro | 16.4 |
| GLM-5.2 | 16.4 |
| Kimi K2 Instruct | 16.4 |
| Inkling | 16.4 |
| Opus 4.5 | 16.4 |
| Gemini 3 Pro Preview | 16.3 |
| DeepSeek-V4-Flash | 16.3 |
| DeepSeek-V3.2 | 16.3 |
| o3 | 16.3 |
| GLM-5.1 | 16.3 |
| Grok 4.5 | 16.3 |
| GPT-5.3 Instant | 16.2 |
| Gemini 2.5 Pro Preview 06-05 | 16.2 |
| Hermes 4 405B | 16.1 |
| Sonnet 4.5 | 16.1 |
| DeepSeek-V3.1 | 16.1 |
| GLM 4.6 | 16.1 |
| GLM-5 | 16.1 |
| MiMo-V2.5-Pro | 16.1 |
| Opus 4 | 16.1 |