Atlas

Benchmarks

← All benchmarks

CharXiv Reasoning

Multimodal · 2024-06-26

CharXiv Reasoning evaluates reasoning over charts drawn from arXiv papers. Scores report answer accuracy on reasoning questions.

Top models (higher is better)

ModelScore
Claude Fable 588.9
Claude Mythos Preview86.1
Gemini 3.6 Flash85.2
Kimi K384.8
GPT-5.6 Sol84.6
Gemini 3.5 Flash84.2
GPT-5.584.1
Gemini 3.1 Pro Preview83.3
GPT-5.6 Luna82.7
Opus 4.782.1
GPT-5.282.1
Grok 4.581.6
Gemini 3 Pro Preview81.4
MiMo-V2.581.0
Qwen3.5 397B A17B80.8
Opus 4.880.5
Kimi K2.680.4
Gemini 3 Flash Preview80.3
GPT-5.4 Mini80.3
o378.6
Inkling78.1
Kimi K2.577.5
Inkling-Small77.4
Sonnet 577.0
Inkling-Small Preview76.7
Gemini 3.5 Flash-Lite74.5
Gemini 3.1 Flash-Lite Preview73.2
Gemini 3.1 Flash-Lite73.2
Qwen3.5-Omni-Plus72.5
Sonnet 4.672.4
O4 Mini72.0
Gemini 2.5 Pro69.6
GPT-5.169.5
Sonnet 4.568.5
Claude 3.7 Sonnet64.2
Gemini 2.5 Flash63.7
Nemotron 3 Nano Omni 30B A3B63.6
Haiku 4.561.7
Qwen3 Omni 30B A3B Thinking61.1
Claude 3.5 Sonnet (June 2024)60.2
Loading Atlas data…