Atlas

Benchmarks

← All benchmarks

IOI 2025 (Vals v2)

Code

The six IOI 2025 problems under Vals' v2 OpenCode protocol without interactive grading feedback. Final solutions receive official subtask points, averaged across the problems.

Top models (higher is better)

ModelScore
Claude Opus 5.5100.0
GPT-6 Astra100.0
GPT-5.6 Sol88.3
Claude Fable 5.187.2
Claude Opus 587.2
GPT-6 Sol79.3
GPT-5.6 Terra77.8
GLM-5.375.5
Gemini 3.7 Flash69.8
Hy4 Preview68.5
Qwen3.8-Max68.3
Gemini 3.8 Flash61.3
Muse Spark 1.361.2
GPT-5.3-Codex57.0
GLM-5.3 Flash56.7
Grok 4.756.2
GPT-5.6 Luna49.8
Grok 4.649.0
DeepSeek V4 Pro 081348.5
Qwen3.8 27B48.5
Sonnet 542.0
Gemini 3.6 Flash40.8
MiMo-V2.6-Pro39.3
GPT-6 Luna39.0
DeepSeek V4.1 Flash35.2
Grok 4.533.5
Kimi K329.3
DeepSeek-V4-Flash-073128.2
Muse Spark 1.223.2
Inkling21.0
Inkling-Small9.2
Mercury 2.53.5
Loading Atlas data…