Atlas

Benchmarks

← All benchmarks

SkillsBench without Skills

Agents · 2026-02-13

SkillsBench resolution rate for the no-Skills condition on the 87-task v1.1 suite. The current site leaderboard publishes this paired ablation for 24 model-harness configurations, with up to three trials per task.

Top models (higher is better)

ModelScore
GPT-5.551.5
GPT-5.448.9
Grok 4.548.8
Muse Spark 1.146.3
Opus 4.845.7
Claude Opus 545.2
GPT-5.6 Luna45.2
GPT-5.6 Terra44.2
GPT-5.6 Sol43.3
Opus 4.743.0
Gemini 3.5 Flash41.1
Gemini 3.1 Pro Preview36.0
Sonnet 535.1
Gemini 3 Flash Preview34.2
Opus 4.633.7
Sonnet 4.633.5
Kimi K2.633.4
GLM-5.132.7
GLM-5.232.2
Qwen3.7-Plus31.1
Kimi K2.7 Code30.4
GPT-5.4 Mini29.9
MiniMax M329.7
GPT-5.229.7
DeepSeek-V4-Flash27.5
DeepSeek-V4-Pro27.2
Opus 4.523.8
Grok 4.322.8
Inkling18.5
MiniMax M2.718.1
Sonnet 4.516.7
Gemini 3.1 Flash-Lite Preview16.0
Haiku 4.58.8
Loading Atlas data…