AA-LCR
Search · 2025-08-05
Artificial Analysis Long Context Reasoning (AA-LCR) tests extraction, reasoning, and synthesis over 10k to 100k token documents such as papers, financial filings, legal text, reports, and marketing materials. Higher scores mean more questions answered correctly.
Top models (higher is better)
| Model | Score |
|---|---|
| GPT-5.2-Codex | 75.7 |
| GPT-5 | 75.6 |
| GPT-5.1 | 75.0 |
| Kimi K3 | 74.7 |
| GPT-5.5 | 74.3 |
| Opus 4.5 | 74.0 |
| GPT-5.3-Codex | 74.0 |
| GPT-5.4 | 74.0 |
| GPT-5.6 Luna | 74.0 |
| GPT-5.6 Terra | 74.0 |
| KAT-Coder-Pro V1 | 74.0 |
| MiniMax M3 | 74.0 |
| GPT-5.6 Sol | 73.7 |
| MiMo-V2.5-Pro | 73.3 |
| Gemini 3.1 Pro Preview | 72.7 |
| GPT-5.2 | 72.7 |
| GLM-5.2 | 71.3 |
| Gemini 3.5 Flash | 71.0 |
| Opus 4.6 | 70.7 |
| Sonnet 4.6 | 70.7 |
| Sonnet 5 | 70.7 |
| Gemini 3 Pro Preview | 70.7 |
| Haiku 4.5 | 70.3 |
| Opus 4.7 | 70.3 |
| Claude Fable 5 | 70.0 |
| Claude Opus 5 | 70.0 |
| Gemini 3.6 Flash | 69.7 |
| Kimi K2.6 | 69.7 |
| Muse Spark | 69.7 |
| Qwen3.6-Max-Preview | 69.7 |
| Qwen3.6 Plus (2026-04-02) | 69.7 |
| GPT-5.4 Mini | 69.3 |
| o3 | 69.3 |
| DeepSeek-V3.2-Exp | 69.0 |
| GPT-5-Codex | 69.0 |
| Qwen3.7-Max | 69.0 |
| MiniMax M2.7 | 68.7 |
| Qwen3.6 27B | 68.7 |
| GPT-5 Mini | 68.0 |
| Grok 4 | 68.0 |