Atlas

Benchmarks

← All benchmarks

Fiction.liveBench

Chat & Writing · 2025-02-19

Long-context creative-writing benchmark testing whether models understand and reason over extended fiction passages.

Top models (higher is better)

ModelScore
GPT-597.2
o3-pro97.2
Grok 494.4
Grok 4 Fast94.4
Gemini 2.5 Pro Preview 06-0591.7
o388.9
Kimi K2.586.1
Claude 3.7 Sonnet83.3
O183.3
QwQ-32B83.3
Gemini 2.5 Flash Preview 05-2077.8
O4 Mini77.8
Qwen3 32B74.2
DeepSeek-R169.4
GPT-5 Mini69.4
MiniMax M1 80k69.4
Qwen3-235B-A22B67.7
ChatGPT-4o Latest observed 2025-01-2966.7
Gemini 2.5 Pro Experimental 03-2566.7
Gemini 2.5 Pro Preview 05-0666.7
Gemini 2.5 Pro Preview 03-2566.7
Grok 3 Mini66.7
Kimi K2 Instruct 090566.7
Qwen2.5-Max66.7
Qwen3-Max (2025-09-23)66.7
GPT-4.163.9
GPT-4.563.9
Qwen3 14B62.5
Qwen3 8B62.1
Opus 461.1
Gemini 2.0 Flash 00161.1
Kimi K2 Instruct61.1
Grok 358.3
DeepSeek-V3.152.8
DeepSeek-V3.2-Exp52.8
Gemini 2.0 Flash Thinking Experimental 01-2152.8
DeepSeek-V3-032450.0
o3-mini50.0
Gemini 2.5 Flash-Lite Preview 06-1747.2
Gemini 2.5 Flash Preview 04-1747.2
Loading Atlas data…