Atlas

Benchmarks

← All benchmarks

MultiChallenge

Chat & Writing · 2025-01-29

Score on realistic multi-turn conversations across retention, memory, editing, and self-coherence.

Top models (higher is better)

ModelScore
Muse Spark75.5
Muse Spark 1.175.3
Gemini 3.1 Pro Preview71.4
GPT-5.4 Pro69.2
Gemini 3 Pro Preview65.7
GPT-5.163.4
GPT-563.2
o3-pro62.4
Kimi K2.561.4
Gemini 3.1 Flash-Lite Preview60.6
GPT-5 Mini59.0
Opus 4.559.0
Opus 458.6
Opus 4.157.2
Sonnet 457.1
o356.6
Opus 4.656.0
Kimi K2 Thinking55.4
Sonnet 4.555.3
Gemini 2.5 Pro53.6
Claude 3.7 Sonnet51.6
GPT-5.1 Instant51.2
Haiku 4.550.5
DeepSeek-V3.146.1
gpt-oss-120b45.3
O4 Mini44.9
Qwen3-235B-A22B41.2
GPT-4.139.4
Gemini 2.0 Flash 00136.4
Loading Atlas data…