Atlas

Benchmarks

← All benchmarks

BLXBench

Code · 2026-04-24

BLXBench evaluates AI coding models on software-engineering tasks such as UI generation, architecture, debugging, and code writing. Its public leaderboard reports an overall score plus pass rate, latency, token throughput, cost, task-domain, and difficulty breakdowns.

Top models (higher is better)

ModelScore
GPT-5.577.9
GPT-5.3-Codex77.7
Qwen3.7-Max75.3
Kimi K2.674.8
MiniMax M374.7
DeepSeek-V4-Pro73.8
MiMo-V2.573.8
MiMo-V2.5-Pro73.1
Grok Build 0.172.8
Nemotron 3 Super 120B A12B72.3
GLM-5.172.1
DeepSeek-V4-Flash71.2
GLM-5.270.8
Mistral Medium 3.570.3
Qwen3.7-Plus69.9
Opus 4.869.7
Qwen3.6-Flash-2026-04-1669.3
CoBuddy68.7
Opus 4.768.1
Nemotron 3 Nano 30B A3B68.0
Mistral Small 467.8
Grok 4.367.6
Granite 4.1 8B67.1
North Mini Code66.3
Kimi K2.7 Code65.7
Ring 2.6 1T65.3
Claude Fable 564.5
Gemini 3.1 Flash-Lite64.2
Nemotron 3 Nano Omni 30B A3B57.9
Step 3.7 Flash55.2
MiniMax M2.751.0
Gemini 3.5 Flash41.5
Loading Atlas data…