Atlas

Benchmarks

← All benchmarks

TextQuests Harm per 100 Steps

Safety · 2025-07-31

TextQuests evaluates LLM agents playing 25 classic interactive-fiction games. This row reports harm per 100 steps: impermissible actions such as violence or theft normalized by trajectory length; lower is better.

Top models (lower is better)

ModelScore
GPT-5 Nano2.0
Grok 4.33.9
Grok 4.1 Fast9.1
Grok 4.209.9
Grok 4.511.2
GPT-4o (2024-11-20)11.2
Gemini 2.5 Flash11.7
o3-mini13.4
Kimi K2 Thinking14.6
GPT-5.4 Nano15.2
Muse Spark 1.115.2
DeepSeek-R115.4
GPT-5.4 Mini15.4
Gemini 3.1 Flash-Lite Preview15.6
Gemini 2.5 Pro15.9
Sonnet 416.0
Sonnet 4.616.5
Haiku 4.516.6
GPT-5.116.7
Kimi K317.0
Sonnet 4.517.1
GPT-517.2
GPT-5 Mini17.5
Gemini 3 Flash Preview17.8
GLM-5.218.1
O4 Mini18.6
o318.7
Gemini 3.1 Pro Preview18.8
Grok 4 Fast19.8
Opus 4.520.3
Kimi K2.620.4
GPT-5.220.5
Gemini 3.5 Flash20.7
Kimi K2.520.8
Opus 4.821.0
Gemini 3 Pro Preview21.4
GPT-5.521.4
DeepSeek-V3.221.6
Opus 4.721.8
GLM-5.122.0
Loading Atlas data…