Atlas

Benchmarks

← All benchmarks

SkillsBench with Skills

Agents · 2026-02-13

SkillsBench resolution rate for the curated-Skills condition on the 87-task v1.1 suite. The current site leaderboard reports 25 model-harness configurations: 24 paired with a no-Skills condition and one audited with-Skills-only result.

Top models (higher is better)

ModelScore
GPT-5.567.3
Grok 4.566.0
Opus 4.761.2
Gemini 3.1 Pro Preview60.8
GPT-5.6 Terra60.6
GPT-5.6 Luna60.4
Claude Opus 560.4
Opus 4.859.2
Muse Spark 1.159.2
GLM-5.158.4
Hy355.9
Gemini 3 Flash Preview54.6
Qwen3.7-Plus54.3
GPT-5.6 Sol54.1
Kimi K2.654.0
MiniMax M353.0
Gemini 3.5 Flash52.7
GPT-5.451.7
GPT-5.251.7
DeepSeek-V4-Pro51.3
Opus 4.650.2
Kimi K2.7 Code50.0
Sonnet 4.649.1
Opus 4.549.0
Sonnet 546.5
GLM-5.245.1
DeepSeek-V4-Flash44.7
Grok 4.341.7
GPT-5.4 Mini41.4
Sonnet 4.536.2
MiniMax M2.734.9
Haiku 4.530.1
Inkling26.1
Gemini 3.1 Flash-Lite Preview20.1
Loading Atlas data…