Atlas

Benchmarks

← All benchmarks

SciCode 1.0.1 (Artificial Analysis)

Code

Artificial Analysis' SciCode 1.0.1 evaluation over 288 test subproblems, with pass@1 averaged over three attempts. The current public data explicitly uses scicode_1_0_1; earlier unversioned SciCode observations are preserved separately.

Top models (higher is better)

ModelScore
Claude Opus 5.566.9
Claude Fable 5.163.1
Claude Fable 561.0
MiMo-V2.6-Pro60.9
Gemini 3.7 Flash59.8
Muse Spark 1.359.7
Kimi K359.5
GLM-5.359.0
Step 5 Preview58.9
Muse Spark 1.158.8
Gemini 3.1 Pro Preview58.7
GPT-5.6 Sol57.8
Grok 4.757.8
GPT-6 Sol57.6
Muse Spark 1.257.4
Gemini 3.8 Flash56.6
GPT-6 Astra56.5
Grok 4.656.5
Claude Opus 556.4
GPT-5.556.1
GPT-5.6 Terra55.0
Grok 4.555.0
GPT-6 Luna54.6
Opus 4.854.4
Sonnet 554.3
Qwen3.8 2.4T A95B54.1
Gemini 3.5 Flash53.9
GPT-5.6 Luna53.6
Gemini 3.6 Flash53.4
Qwen3.8-Max53.2
GPT-5.5 Instant (2026-06-25 hosted snapshot)52.5
GPT-5.4 Mini52.1
Qwen3.8 Max (0902)52.1
DeepSeek V4.1 Flash51.9
Agnes 3.0 Flash (hosted)51.6
GLM-5.3 Flash51.6
Kimi K2.651.5
GLM-5.251.2
DeepSeek V4 Pro 081351.0
DeepSeek-V4-Pro50.8
Loading Atlas data…