Atlas

Benchmarks

← All benchmarks

LiveBench Agentic Coding Average

Code · 2025-05-30

LiveBench leaderboard aggregate for livebench agentic coding average. LiveBench is refreshed over time to reduce contamination and covers reasoning, coding, mathematics, language, data analysis, instruction following, and agentic coding.

Top models (higher is better)

ModelScore
Opus 4.856.1
GPT-5.453.8
GPT-5.552.1
GLM-5.251.9
Sonnet 551.1
Opus 4.750.7
Claude Fable 550.7
GPT-5.250.3
GPT-5.2-Codex49.4
Opus 4.649.0
Gemini 3.5 Flash49.0
Kimi K2.646.9
GPT-5.4 Nano46.8
Grok Build 0.145.8
Kimi K2.7 Code45.7
Gemini 3.1 Pro Preview45.4
Qwen3.7-Max43.6
Sonnet 4.642.6
DeepSeek-V4-Pro42.6
GPT-5.4 Mini41.7
Qwen3.6 Plus (2026-04-02)41.4
MiniMax M340.7
Opus 4.539.7
Qwen3.6 27B39.3
DeepSeek-V4-Flash37.6
Grok 4.318.5
Loading Atlas data…