Atlas

Benchmarks

← All benchmarks

LiveBench Coding Average

Code · 2024-06-12

LiveBench leaderboard aggregate for livebench coding average. LiveBench is refreshed over time to reduce contamination and covers reasoning, coding, mathematics, language, data analysis, instruction following, and agentic coding.

Top models (higher is better)

ModelScore
GPT-5.2-Codex83.6
Claude Fable 582.5
GPT-5.582.2
Opus 4.782.1
Sonnet 580.7
Opus 4.579.7
GLM-5.279.7
Opus 4.879.3
Sonnet 4.679.3
Kimi K2.678.6
Opus 4.678.2
Gemini 3.5 Flash78.2
Qwen3.6 Plus (2026-04-02)78.2
GPT-5.477.5
Gemini 3.1 Pro Preview76.5
GPT-5.276.1
Qwen3.7-Max74.2
Kimi K2.7 Code74.0
Qwen3.6 27B71.8
GPT-5.4 Mini71.6
GPT-5.4 Nano70.8
DeepSeek-V4-Pro70.0
Grok 4.369.9
DeepSeek-V4-Flash69.2
MiniMax M368.2
Grok Build 0.165.4
Loading Atlas data…