Atlas

Benchmarks

← All benchmarks

Vals Multimodal Index SWE-bench

Indexes · 2026-06-10

This row reports the component score for SWE-bench within the Vals Multimodal Index composite.

Top models (higher is better)

ModelScore
GPT-5.6 Sol99.0
Claude Fable 597.1
Claude Opus 595.1
Kimi K395.1
GPT-5.6 Luna93.1
Opus 4.889.2
Grok 4.586.3
GPT-5.582.6
Opus 4.782.4
Muse Spark 1.178.4
Sonnet 4.677.5
Gemini 3.6 Flash77.5
Sonnet 575.5
Gemini 3.5 Flash75.5
Kimi K2.674.5
GPT-5.6 Terra73.5
Gemini 3.1 Pro Preview72.5
Grok 4.370.6
Qwen3.6 Plus (2026-04-02)70.6
MiniMax M369.6
Gemini 3 Flash Preview68.6
GPT-5.4 Mini67.6
GPT-5.4 Nano67.6
Grok 4.2066.7
Qwen3.7-Plus66.7
Haiku 4.564.7
MiMo-V2.564.7
Mistral Medium 3.564.7
Gemini 3.1 Flash-Lite Preview57.8
Loading Atlas data…