Atlas

Benchmarks

← All benchmarks

Chartography

Multimodal · 2026-07-16

Professional graphical-reasoning benchmark testing whether models can interpret domain-native charts such as Kaplan-Meier curves, candlestick charts, contour maps, Sankey diagrams, Bode plots, growth curves, and wind roses.

Top models (higher is better)

ModelScore
Claude Mythos 585.2
Claude Opus 583.0
Opus 4.875.0
GPT-5.6 Sol45.0
Gemini 3.5 Flash35.9
Claude Fable 534.8
Gemini 3.6 Flash34.0
GPT-5.6 Terra34.0
GPT-5.6 Luna31.4
GPT-5.531.0
GPT-5.429.6
Kimi K326.6
Gemini 3.1 Pro Preview26.1
Muse Spark 1.124.4
Grok 4.517.3
Sonnet 516.6
Opus 4.716.5
Qwen3.5 Plus (2026-02-15)15.9
Qwen3.7-Plus15.8
Grok 4.312.9
Kimi K2.512.6
Kimi K2.612.2
Gemini 3.5 Flash-Lite10.2
Mistral Large 3 675B Instruct 25129.0
Inkling3.4
Loading Atlas data…