Atlas

Benchmarks

← All benchmarks

TextQuests Game Progress

Games · 2025-07-31

TextQuests evaluates LLM agents playing 25 classic interactive-fiction games. This row reports game progress, the percentage progress toward completing all games; higher is better.

Top models (higher is better)

ModelScore
Claude Fable 556.1
GPT-5.6 Sol52.1
GPT-5.548.9
Gemini 3.1 Pro Preview45.8
GPT-5.442.2
Gemini 3 Pro Preview41.0
Opus 4.640.8
GPT-5.6 Terra40.5
Opus 4.840.1
Kimi K340.0
Opus 4.538.7
Opus 4.737.0
GPT-5.237.0
Gemini 3 Flash Preview36.4
Gemini 3.5 Flash35.7
GPT-5.134.2
GLM-5.233.3
Sonnet 4.631.5
Sonnet 4.531.0
o330.9
GPT-5.6 Luna30.8
GPT-530.0
GPT-5.4 Mini29.6
GLM-5.129.5
Grok 427.8
Kimi K2.627.4
Grok 4.525.4
Muse Spark 1.124.9
Sonnet 424.7
Kimi K2.524.4
Gemini 2.5 Pro23.2
DeepSeek-V3.221.2
DeepSeek-V4-Pro20.3
Grok 4 Fast20.1
Gemini 3.1 Flash-Lite Preview18.8
Grok 4.2018.5
Kimi K2 Thinking18.3
GPT-5 Mini17.6
Grok 4.1 Fast16.4
DeepSeek-R115.2
Loading Atlas data…