Atlas

Benchmarks

← All benchmarks

LiveBench Reasoning Average

General QA · 2024-06-12

LiveBench leaderboard aggregate for livebench reasoning average. LiveBench is refreshed over time to reduce contamination and covers reasoning, coding, mathematics, language, data analysis, instruction following, and agentic coding.

Top models (higher is better)

ModelScore
Opus 4.889.7
GPT-5.589.7
Sonnet 588.7
Opus 4.688.7
GPT-5.488.1
Claude Fable 587.7
Opus 4.787.2
Sonnet 4.684.8
Gemini 3.1 Pro Preview84.0
Qwen3.7-Max83.3
GPT-5.283.2
Kimi K2.7 Code82.8
DeepSeek-V4-Pro82.7
Gemini 3.5 Flash82.0
GPT-5.4 Nano81.1
Opus 4.580.1
Kimi K2.679.4
GLM-5.278.6
GPT-5.2-Codex77.7
Grok Build 0.176.4
Qwen3.6 Plus (2026-04-02)75.8
MiniMax M374.5
GPT-5.4 Mini71.3
Grok 4.370.8
DeepSeek-V4-Flash70.6
Qwen3.6 27B70.3
Loading Atlas data…