Atlas

Benchmarks

← All benchmarks

MRCR v2 (8-needle) - 128K average

General QA · 2026-03-03

MRCR v2 is Google DeepMind’s synthetic multi-round coreference-resolution evaluation for long-context reasoning beyond retrieval. This 8-needle metric is the cumulative average through 128K tokens, using string similarity between the requested prior response and the model’s reproduction.

Top models (higher is better)

ModelScore
GPT-5.594.8
Gemini 3.6 Flash91.8
Gemini 3.1 Pro Preview84.9
Sonnet 4.684.9
Opus 4.684.0
Grok 4.581.4
Gemini 3.5 Flash77.3
Gemini 3 Pro Preview77.0
GPT-5.6 Luna74.8
Gemini 3.5 Flash-Lite72.2
Sonnet 571.6
Gemini 3 Flash Preview67.2
GPT-5.161.6
Gemini 3.1 Flash-Lite Preview60.1
Gemini 3.1 Flash-Lite60.1
Opus 4.759.3
Gemini 2.5 Pro58.0
o357.1
Grok 4.1 Fast54.6
Gemini 2.5 Flash54.3
GPT-5 Mini52.5
Gemini 2.5 Flash Preview (09-2025)52.4
Sonnet 4.547.1
GPT-5.4 Mini42.7
Sonnet 439.1
O4 Mini36.3
Haiku 4.535.3
Grok 334.0
Gemini 2.5 Flash-Lite30.6
Gemini 2.5 Flash-Lite Preview (09-2025)25.6
Gemini 2.0 Flash19.0
Opus 416.1
Loading Atlas data…