Atlas

Benchmarks

← All benchmarks

LiveCodeBench

Code · 2024-03-12

LiveCodeBench evaluates code generation on newly released competitive-programming problems to limit contamination. Scores report pass@1 accuracy in percentage points.

Top models (higher is better)

ModelScore
Gemini 2.5 Deep Think87.6
GPT-5 Mini80.4
Grok 479.0
Grok 4.1 Fast76.5
O4 Mini75.8
Gemini 2.5 Pro Preview 05-0675.6
o372.0
Gemini 3.1 Flash-Lite Preview72.0
Gemini 2.5 Flash Preview (09-2025)71.7
Grok 370.6
DeepSeek-R1-052870.5
Gemini 2.5 Pro Experimental 03-2570.4
DeepSeek-R164.3
Gemini 2.5 Flash63.9
Gemini 2.5 Flash Preview 04-1763.5
Gemini 2.5 Flash-Lite Preview (09-2025)58.4
Haiku 4.553.2
Opus 451.1
Sonnet 448.9
Gemini 2.5 Flash-Lite34.3
Gemini 1.5 Pro34.2
Gemini 1.5 Flash30.7
Gemini 2.0 Flash-Lite28.9
Loading Atlas data…