AA-Omniscience Index
Indexes · 2025-11-16
Factual recall and hallucination benchmark across economically relevant domains; higher scores mean more correct answers and fewer hallucinations.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 40.1 |
| Gemini 3.1 Pro Preview | 32.9 |
| Claude Opus 5 | 31.3 |
| Opus 4.8 | 27.4 |
| Grok 4.5 | 26.4 |
| Opus 4.7 | 26.2 |
| Gemini 3.6 Flash | 23.5 |
| Gemini 3.5 Flash | 22.7 |
| GPT-5.6 Sol | 21.7 |
| GPT-5.5 | 20.1 |
| Kimi K3 | 18.4 |
| Grok 4.3 | 18.3 |
| Muse Spark 1.1 | 18.0 |
| Gemini 3 Pro Preview | 15.8 |
| Grok 4.20 | 15.3 |
| Sonnet 5 | 15.3 |
| Qwen3.7-Max | 14.1 |
| Opus 4.6 | 13.5 |
| Opus 4.5 | 13.3 |
| Sonnet 4.6 | 12.4 |
| Gemini 3 Flash Preview | 11.6 |
| GPT-5.5 Instant | 10.3 |
| Qwen3.6-Max-Preview | 10.2 |
| GPT-5.3-Codex | 9.9 |
| Grok Build 0.1 | 7.4 |
| Gemini 3.5 Flash-Lite | 6.9 |
| Kimi K2.6 | 6.4 |
| GPT-5.4 | 5.7 |
| GPT-5.1 | 5.5 |
| MiMo-V2-Pro | 4.9 |
| Muse Spark | 4.1 |
| GLM-5.2 | 4.0 |
| Grok 4 | 3.8 |
| MiMo-V2.5-Pro | 3.6 |
| GPT-5.5 Instant (2026-06-25 hosted snapshot) | 3.5 |
| Qwen3.6 Plus (2026-04-02) | 2.6 |
| Qwen3.7-Plus | 2.4 |
| Inkling | 2.0 |
| GLM-5 | 2.0 |
| GLM-5.1 | 1.9 |