Atlas
/
Benchmarks
137 sources · 855 models × 1278 benchmarks · 74,806 scores
☾
☀
Capabilities
Models
Compare
Benchmarks
Coverage
Methodology
← All benchmarks
Spanish
General QA · 2024-06-01
Elo rating on Scale SEAL's Spanish multilingual prompt set.
Top models
(higher is better)
Model
Score
Gemini Exp-1206
1176
O1
1134
Gemini 2.0 Flash Experimental
1119
o1 Preview
1111
Gemini 2.0 Flash Thinking Experimental 01-21
1108
Gemini Experimental 1121
1105
GPT-4o
1084
o3-mini
1079
Gemini 1.5 Pro Preview 0514
1069
Gemini 1.5 Pro Experimental 0827
1067
GPT-4o (2024-08-06)
1067
GPT-4 Turbo (1106 Preview)
1034
Mistral Large 2 (Instruct 2407)
1032
GPT-4 0125 Preview
1020
Gemini 1.5 Pro Preview 0409
1005
Claude 3.5 Sonnet (June 2024)
992
Aya Expanse 32B
983
Gemini 1.5 Flash Preview 0514
980
Gemma 2 27B
951
Llama 3.2 90B Vision Instruct
944
Opus 3
919
Llama 3.1 405B Instruct
915
Loading Atlas data…