Atlas

Benchmarks

← All benchmarks

MATH-Vision

Multimodal · 2024-02-22

MATH-Vision evaluates visual mathematical reasoning on 3,040 problems drawn from real competitions across 16 disciplines and five difficulty levels. Scores are reported as answer accuracy.

Top models (higher is better)

ModelScore
GPT-5.6 Sol95.8
Claude Fable 594.8
Kimi K394.3
GPT-5.592.2
GPT-5.492.0
Gemini 3 Flash Preview90.6
Gemini 3.1 Pro Preview89.8
Doubao Seed 2.0 Pro88.8
Qwen3.5 397B A17B88.6
Kimi K2.687.4
Opus 4.886.7
Gemini 3 Pro Preview86.6
Qwen3.5 122B A10B86.2
Qwen3.5-27B86.0
Kimi K2.584.2
Qwen3.5 35B A3B83.9
GPT-5.283.0
Doubao Seed 1.677.2
Opus 4.577.1
Step3-VL-10B76.0
Qwen3 VL 235B A22B Thinking74.6
Gemini 2.5 Pro73.3
GPT-572.0
GPT-5 Mini (2025-08-07)71.9
Opus 4.671.2
Sonnet 4.571.1
Qwen3-VL-235B-A22B-Instruct66.0
Opus 4.166.0
GLM-4.5V65.6
GLM-4.6V63.5
O160.3
Qwen3 VL 8B Thinking59.6
Claude 3.7 Sonnet58.6
O4 Mini (2025-04-16)58.0
Kimi-VL-A3B-Thinking-250656.9
GLM-4.1V-9B-Thinking54.4
GLM 4.6V Flash54.0
InternVL3.5-8B52.0
Gemini 2.0 Pro Experimental 02-0548.1
GPT-4.547.3
Loading Atlas data…