Atlas

Benchmarks

← All benchmarks

MGSM Thai

Math · 2022-10-06

Thai language split of the MGSM multilingual grade-school math benchmark.

Top models (higher is better)

ModelScore
GPT-5.297.6
Opus 4.596.4
Gemini 3 Flash Preview96.4
gpt-oss-120b96.4
Grok 496.0
Gemini 3 Pro Preview95.2
GPT-595.2
Claude 3.7 Sonnet94.8
Gemini 2.5 Flash Preview (09-2025)94.8
o394.8
Qwen3-235B-A22B94.8
Qwen3 Max Preview94.8
Sonnet 4.594.4
DeepSeek-R194.4
GPT-5.194.4
GPT-5 Mini94.4
o3-mini94.4
O4 Mini94.4
Qwen3 Max (rolling alias)94.4
Opus 4.194.0
Opus 494.0
Grok 4 Fast94.0
O194.0
Sonnet 493.6
GLM-4.793.6
Llama 3.3 70B Instruct93.6
Haiku 4.593.2
Gemini 2.0 Flash 00193.2
Gemini 2.5 Flash-Lite Preview (09-2025)93.2
GPT-4.193.2
Grok 393.2
Grok 4.1 Fast93.2
DeepSeek-V3-032492.8
DeepSeek-V3.292.8
GLM-4.592.8
GPT-4o (2024-11-20)92.8
Grok 3 Mini92.8
Llama 4 Maverick Instruct92.8
GLM 4.692.4
GPT-4o (2024-08-06)92.4
Loading Atlas data…