Atlas

Benchmarks

← All benchmarks

SciCode (Artificial Analysis)

Science · 2024-07-12

Artificial Analysis evaluation of SciCode, a scientist-curated research-coding benchmark. SciCode contains 338 subproblems from 80 main problems across 16 subfields; the standard test split has 288 subproblems from 65 main problems. The reported score is pass@1/accuracy over solved subproblems.

Top models (higher is better)

ModelScore
Claude Fable 560.2
Gemini 3.1 Pro Preview59.0
Kimi K358.7
Muse Spark 1.158.2
GPT-5.6 Sol56.9
GPT-5.456.6
GPT-5.556.1
Claude Opus 555.7
GPT-5.2-Codex54.6
Opus 4.754.5
Grok 4.554.1
GPT-5.6 Terra53.9
Sonnet 553.6
Opus 4.853.5
Kimi K2.653.5
GPT-5.3-Codex53.2
Gemini 3.5 Flash53.1
Gemini 3.6 Flash52.7
GPT-5.6 Luna52.5
Muse Spark51.5
Gemini 3 Flash Preview50.6
GLM-5.250.5
GPT-5.5 Instant50.3
Grok Build 0.150.2
MiMo-V2.5-Pro50.2
DeepSeek-V4-Pro50.0
DeepSeek-V4-Flash-073149.9
Gemini 3 Pro Preview49.9
GPT-5.4 Mini49.9
Opus 4.549.5
Kimi K2.549.0
Qwen3.7-Max48.8
Inkling-Small48.7
GPT-5.5 Instant (2026-06-25 hosted snapshot)48.6
Hy347.6
Kimi K2.7 Code47.5
Grok 4.347.3
MiniMax M2.747.0
Sonnet 4.646.9
GPT-5.4 Nano46.9
Loading Atlas data…