Atlas

Benchmarks

← All benchmarks

MGSM Chinese

Math · 2022-10-06

Chinese language split of the MGSM multilingual grade-school math benchmark.

Top models (higher is better)

ModelScore
Opus 4.594.8
Gemini 3 Flash Preview94.8
Gemini 3 Pro Preview94.8
Sonnet 4.594.4
GPT-5.294.0
o3-mini94.0
Haiku 4.593.6
Opus 4.193.6
GPT-593.6
GPT-5 Mini93.6
O4 Mini93.6
Sonnet 493.2
GPT-5.193.2
Kimi K2 Thinking93.2
Mistral Medium 393.2
Qwen3 Max Preview93.2
Claude 3.7 Sonnet92.8
DeepSeek-V3.292.8
Claude 3.5 Sonnet (Oct 2024)92.4
GLM-4.792.4
gpt-oss-120b92.4
Grok 392.4
Grok 492.4
o392.4
Qwen3-235B-A22B92.4
DeepSeek-V3-032492.0
Gemini 2.5 Flash Preview (09-2025)92.0
GPT-4.192.0
Grok 4 Fast92.0
Llama 3.3 70B Instruct92.0
O192.0
Qwen3 Max (rolling alias)92.0
Opus 491.6
DeepSeek-R191.6
DeepSeek-V391.6
GPT-4o (2024-08-06)91.6
GPT-4o (2024-11-20)91.6
Kimi K2 Instruct91.6
Llama 4 Maverick Instruct91.6
Mistral Large 3 675B Instruct 251291.6
Loading Atlas data…