Atlas

Benchmarks

← All benchmarks

CharXiv Reasoning (with tools)

Multimodal · 2024-06-26

This CharXiv subtrack evaluates reasoning over scientific-paper figures with Python tools available. Scores report answer accuracy in percentage points.

Top models (higher is better)

ModelScore
Claude Fable 593.5
Claude Mythos Preview93.2
Kimi K391.3
Opus 4.791.0
Opus 4.889.9
Gemini 3.6 Flash89.4
GPT-5.6 Sol89.1
GPT-5.589.0
Sonnet 588.3
Kimi K2.686.7
Sonnet 4.685.1
Gemini 3.5 Flash84.9
Inkling-Small Preview83.4
Gemini 3.1 Pro Preview83.2
Inkling82.0
Inkling-Small81.3
Opus 4.678.9
Kimi K2.578.7
Gemini 3.5 Flash-Lite76.5
Gemini 3.1 Flash-Lite75.6
GPT-5 Mini75.5
Loading Atlas data…