Atlas

Benchmarks

← All benchmarks

Arena Vision — Homework (Style Controlled)

Multimodal

Style-controlled Vision Arena rating for visually grounded homework prompts. Higher ratings indicate stronger preference in blind pairwise user votes after adjusting for response style.

Top models (higher is better)

ModelScore
Claude Fable 51343
Claude Opus 51341
GPT-5.51339
Opus 4.81338
GPT-5.41329
Opus 4.71329
Gemini 3.5 Flash1325
Grok 4.51325
Opus 4.61324
Sonnet 51314
GPT-5.6 Terra1312
GPT-5.6 Sol1312
Gemini 3.1 Pro Preview1310
Gemini 3 Pro Preview1309
Gemini 3 Flash Preview1308
Kimi K2.61302
Sonnet 4.61301
Muse Spark1300
Gemma 4 31B1300
GPT-5.4 Mini1292
Kimi K2.51290
Gemma 4 26B A4B1284
GPT-5.21283
GPT-5.11282
Qwen3.5 397B A17B1282
GPT-5.6 Luna1278
Muse Spark 1.11277
Qwen3.7-Plus1277
Gemini 2.5 Pro1272
Gemini 3.1 Flash-Lite Preview1270
Gemini 2.5 Flash Preview (09-2025)1266
MiniMax M31264
MiMo-V2.51262
GPT-51260
Grok 4.31255
GLM 5V Turbo1254
Qwen3.5 122B A10B1253
O4 Mini (2025-04-16)1251
GPT-4.1 (2025-04-14)1249
O3 (2025-04-16)1247
Loading Atlas data…