Atlas

Benchmarks

← All benchmarks

MGSM Japanese

Math · 2022-10-06

Japanese language split of the MGSM multilingual grade-school math benchmark.

Top models (higher is better)

ModelScore
Opus 4.593.6
Gemini 3 Pro Preview93.6
GPT-5.193.2
GPT-5.292.4
Opus 4.192.0
Gemini 3 Flash Preview92.0
GPT-592.0
DeepSeek-R191.6
o391.6
Sonnet 4.591.2
Haiku 4.590.8
Opus 490.8
DeepSeek-V390.8
Qwen3-235B-A22B90.8
Mistral Medium 390.4
o3-mini90.4
Qwen3 Max (rolling alias)90.4
Sonnet 490.0
DeepSeek-V3-032490.0
GLM-4.590.0
MiniMax M2.190.0
Mistral Large 3 675B Instruct 251290.0
O190.0
O4 Mini90.0
Claude 3.5 Sonnet (Oct 2024)89.6
Claude 3.7 Sonnet89.6
DeepSeek-V3.289.6
Gemini 2.5 Flash Preview (09-2025)89.6
GLM 4.689.6
GLM-4.789.6
Kimi K2 Instruct89.6
GPT-5 Mini89.2
gpt-oss-20b89.2
Grok 4 Fast89.2
Qwen3 Max Preview89.2
Gemini 2.5 Flash-Lite Preview (09-2025)88.8
GPT-4.1 Mini88.8
gpt-oss-120b88.8
Grok 488.8
Grok 288.0
Loading Atlas data…