Atlas

Benchmarks

← All benchmarks

Hemingway-bench

Chat & Writing · 2026-02-04

Elo rating on real-world writing tasks graded by expert writers.

Top models (higher is better)

ModelScore
Claude Fable 51118
Gemini 3.6 Flash1076
Gemini 3.1 Pro Preview1069
Kimi K31065
Gemini 3.5 Flash1064
GPT-5.6 Sol1060
Claude Opus 51057
Gemini 3 Pro Preview1053
Gemini 3 Flash Preview1051
Opus 4.61043
Opus 4.71039
Opus 4.81038
GPT-5.51036
GLM-5.21032
Kimi K2.61026
Opus 4.51014
DeepSeek-V4-Pro998
Sonnet 4.6996
Kimi K2.5991
GPT-5.2 Instant989
Qwen3.5 Plus (2026-02-15)989
Gemini 3.5 Flash-Lite984
GPT-5.4980
Muse Spark 1.1978
DeepSeek-V4-Flash976
Grok 4.5973
GPT-5.2954
Qwen3 Max (rolling alias)948
Grok 4.1 Fast918
Kimi K2 Instruct885
Llama 4 Maverick806
Nova 2 Pro (Preview)754
Loading Atlas data…