Atlas

Benchmarks

← All benchmarks

AA-LCR

Search · 2025-08-05

Artificial Analysis Long Context Reasoning (AA-LCR) tests extraction, reasoning, and synthesis over 10k to 100k token documents such as papers, financial filings, legal text, reports, and marketing materials. Higher scores mean more questions answered correctly.

Top models (higher is better)

ModelScore
GPT-5.2-Codex75.7
GPT-575.6
GPT-5.175.0
Kimi K374.7
GPT-5.574.3
Opus 4.574.0
GPT-5.3-Codex74.0
GPT-5.474.0
GPT-5.6 Luna74.0
GPT-5.6 Terra74.0
KAT-Coder-Pro V174.0
MiniMax M374.0
GPT-5.6 Sol73.7
MiMo-V2.5-Pro73.3
Gemini 3.1 Pro Preview72.7
GPT-5.272.7
GLM-5.271.3
Gemini 3.5 Flash71.0
Opus 4.670.7
Sonnet 4.670.7
Sonnet 570.7
Gemini 3 Pro Preview70.7
Haiku 4.570.3
Opus 4.770.3
Claude Fable 570.0
Claude Opus 570.0
Gemini 3.6 Flash69.7
Kimi K2.669.7
Muse Spark69.7
Qwen3.6-Max-Preview69.7
Qwen3.6 Plus (2026-04-02)69.7
GPT-5.4 Mini69.3
o369.3
DeepSeek-V3.2-Exp69.0
GPT-5-Codex69.0
Qwen3.7-Max69.0
MiniMax M2.768.7
Qwen3.6 27B68.7
GPT-5 Mini68.0
Grok 468.0
Loading Atlas data…