Atlas

Benchmarks

← All benchmarks

MGSM Russian

Math · 2022-10-06

Russian language split of the MGSM multilingual grade-school math benchmark.

Top models (higher is better)

ModelScore
GPT-5.197.2
Opus 4.596.8
Sonnet 4.596.8
GLM-4.796.8
Claude 3.7 Sonnet96.4
Opus 4.196.4
Gemini 3 Pro Preview96.4
Opus 496.0
Sonnet 496.0
Gemini 2.0 Flash 00196.0
Gemini 3 Flash Preview96.0
GPT-596.0
GPT-4o (2024-08-06)95.6
GPT-5 Mini95.6
Grok 395.6
O195.6
o395.6
O4 Mini95.6
Qwen3-235B-A22B95.6
Qwen3 Max (rolling alias)95.6
Command A95.2
GPT-5.295.2
gpt-oss-120b95.2
gpt-oss-20b95.2
Grok 4 Fast95.2
Llama 3.3 70B Instruct95.2
Haiku 4.594.8
Gemini 2.5 Flash Preview (09-2025)94.8
GLM 4.694.8
Mistral Medium 394.8
Claude 3.5 Sonnet (Oct 2024)94.4
GLM-4.594.4
GPT-4.1 Mini94.4
Kimi K2 Thinking94.4
Mistral Large 3 675B Instruct 251294.4
Qwen3 Max Preview94.4
GPT-4.194.0
Grok 494.0
Kimi K2 Instruct94.0
Llama 4 Maverick Instruct94.0
Loading Atlas data…