Atlas

Benchmarks

← All benchmarks

Chinese

General QA · 2024-12-18

Elo rating on Scale SEAL's Chinese multilingual prompt set.

Top models (higher is better)

ModelScore
O11165
o3-mini1156
Gemini 1.5 Pro Experimental 08271120
o1 Preview1120
Gemini Exp-12061117
Gemini 2.0 Flash Experimental1115
Gemini Experimental 11211077
Gemini 2.0 Flash Thinking Experimental 01-211060
DeepSeek-R11052
DeepSeek-V31031
GPT-4o (2024-08-06)1029
Gemini 1.5 Flash Preview 05141015
Mistral Large 2 (Instruct 2407)1006
DeepSeek-V2-Chat996
GPT-4 Turbo (1106 Preview)985
Aya Expanse 32B967
Gemma 2 27B966
Claude 3.5 Sonnet (June 2024)930
Qwen2 72B Instruct902
Llama 3.3 70B Instruct883
Yi 1.5 34B Chat780
Loading Atlas data…