Atlas
/
Benchmarks
137 sources · 855 models × 1278 benchmarks · 74,806 scores
☾
☀
Capabilities
Models
Compare
Benchmarks
Coverage
Methodology
← All benchmarks
Chinese
General QA · 2024-12-18
Elo rating on Scale SEAL's Chinese multilingual prompt set.
Top models
(higher is better)
Model
Score
O1
1165
o3-mini
1156
Gemini 1.5 Pro Experimental 0827
1120
o1 Preview
1120
Gemini Exp-1206
1117
Gemini 2.0 Flash Experimental
1115
Gemini Experimental 1121
1077
Gemini 2.0 Flash Thinking Experimental 01-21
1060
DeepSeek-R1
1052
DeepSeek-V3
1031
GPT-4o (2024-08-06)
1029
Gemini 1.5 Flash Preview 0514
1015
Mistral Large 2 (Instruct 2407)
1006
DeepSeek-V2-Chat
996
GPT-4 Turbo (1106 Preview)
985
Aya Expanse 32B
967
Gemma 2 27B
966
Claude 3.5 Sonnet (June 2024)
930
Qwen2 72B Instruct
902
Llama 3.3 70B Instruct
883
Yi 1.5 34B Chat
780
Loading Atlas data…