Atlas

Benchmarks

← All benchmarks

LiveCodeBench (Vals AI public dataset)

Code · 2024-03-12

Vals AI LiveCodeBench public-dataset evaluation surface with its own sampling, max-output-token, temperature, cost, and latency settings. Keep separate from official LiveCodeBench and Artificial Analysis rows.

Top models (higher is better)

ModelScore
Claude Fable 589.8
Claude Opus 589.0
Gemini 3.1 Pro Preview88.5
Gemini 3.6 Flash88.1
GPT-5.2-Codex88.0
Opus 4.887.8
Gemini 3.5 Flash87.6
DeepSeek-V4-Pro87.5
Grok 4.587.4
GPT-5.3-Codex87.3
Kimi K387.2
Qwen3.7-Max87.1
Kimi K2.686.8
GPT-5 Mini86.6
GPT-5.186.5
Gemini 3 Pro Preview86.4
Nemotron 3 Ultra 550B A55B86.0
Qwen3.6 Plus (2026-04-02)86.0
GPT-5.6 Terra85.9
GPT-585.9
Muse Spark 1.185.9
Gemini 3 Flash Preview85.6
GPT-5.1-Codex85.5
Inkling85.5
GPT-5.285.4
Qwen3.5 Plus (2026-02-15)85.3
GPT-5.585.3
Opus 4.785.1
GPT-5-Codex84.7
Opus 4.684.7
Grok 4.384.5
Grok 4.2084.3
GPT-5.484.1
GPT-5.4 Nano84.0
o383.9
Kimi K2.583.9
Opus 4.583.7
GPT-5.1-Codex-Max83.6
Qwen3.5-Flash83.3
Grok 483.2
Loading Atlas data…