Atlas

Benchmarks

← All benchmarks

MMMU-Pro (Vals 4-Option)

Multimodal

Vals AI evaluates approximately 1,700 questions from the MMMU-Pro dataset using a four-option multiple-choice format, the official chain-of-thought prompt, and pass@1 scoring. This source-specific protocol is distinct from canonical ten-option MMMU-Pro and from standard MMMU.

Top models (higher is better)

ModelScore
Claude Opus 589.9
Claude Fable 589.3
GPT-5.6 Sol88.8
Gemini 3.6 Flash88.4
Gemini 3.5 Flash88.3
GPT-5.588.3
Gemini 3.1 Pro Preview88.2
Kimi K388.2
Gemini 3 Flash Preview87.6
Gemini 3 Pro Preview87.5
GPT-5.487.5
Muse Spark87.4
GPT-5.286.7
Opus 4.886.6
Muse Spark 1.186.6
GPT-5.6 Terra86.5
Kimi K2.686.3
Opus 4.785.5
GPT-5.6 Luna85.0
Kimi K2.584.3
Qwen3.6 Plus (2026-04-02)84.2
Opus 4.683.9
Sonnet 4.683.6
Gemini 3.5 Flash-Lite83.6
Grok 4.2083.5
GPT-5.183.2
Grok 4.383.1
Sonnet 583.0
Opus 4.582.9
Gemini 3.1 Flash-Lite Preview82.5
Qwen3.5-Flash81.9
GPT-581.5
Gemini 2.5 Pro Experimental 03-2581.3
MiniMax M381.2
Gemini 2.5 Flash Preview (09-2025)80.8
o380.4
MiMo-V2.580.0
O4 Mini79.7
Sonnet 4.579.3
GPT-5.4 Mini79.2
Loading Atlas data…