Atlas

Benchmarks

← All benchmarks

LiveCodeBench (Vals Public) - Medium

Code · 2024-03-12

The medium difficulty slice of Vals AI's LiveCodeBench public-dataset evaluation surface.

Top models (higher is better)

ModelScore
GPT-592.7
Qwen3.6 Plus (2026-04-02)91.6
DeepSeek-V4-Pro91.1
Claude Fable 590.9
Claude Opus 590.6
Gemini 3.5 Flash90.6
Gemini 3.6 Flash90.6
GPT-5.2-Codex90.3
Nemotron 3 Ultra 550B A55B90.3
Qwen3.5 Plus (2026-02-15)90.1
Opus 4.889.8
Gemini 3.1 Pro Preview89.8
Grok 489.8
Inkling89.8
Kimi K2.689.8
Muse Spark 1.189.8
GPT-5.189.6
Grok 4.589.6
Opus 4.689.3
Opus 4.789.3
Gemini 3 Pro Preview89.3
GPT-5 Nano89.3
o389.3
O4 Mini89.3
Qwen3.7-Max89.3
GPT-5.1-Codex89.0
GPT-5 Mini89.0
Grok 4.389.0
GPT-5.4 Nano88.5
Kimi K388.5
Qwen3.5-Flash88.5
Opus 4.588.3
Kimi K2.588.3
Gemini 3 Flash Preview88.0
GLM-588.0
MiniMax M388.0
GLM-5.188.0
GPT-5.1-Codex-Max87.7
GPT-5.3-Codex87.7
GPT-5.587.7
Loading Atlas data…