Atlas
/
Benchmarks
137 sources · 855 models × 1278 benchmarks · 74,806 scores
☾
☀
Capabilities
Models
Compare
Benchmarks
Coverage
Methodology
← All benchmarks
Arabic
General QA · 2024-12-18
Elo rating on Scale SEAL's Arabic multilingual prompt set.
Top models
(higher is better)
Model
Score
Gemini 1.5 Pro Experimental 0827
1147
Gemini Exp-1206
1138
Gemini 2.0 Flash Thinking Experimental 01-21
1120
O1
1120
Gemini Experimental 1121
1116
o3-mini
1093
Gemini 2.0 Flash Experimental
1090
o1 Preview
1087
GPT-4o (2024-08-06)
1066
Aya Expanse 32B
1025
GPT-4 Turbo (1106 Preview)
1011
Claude 3.5 Sonnet (June 2024)
995
Mistral Large 2 (Instruct 2407)
970
Gemini 1.5 Flash Preview 0514
967
Aya-23-35B
932
Llama 3.1 405B Instruct
875
Llama 3.3 70B Instruct
808
Gemma 2 27B
661
Loading Atlas data…