Atlas

Benchmarks

← All benchmarks

FrontierSWE: FrogsGame Post-Training (Mean@5)

Code · 2026-04-16

Post-train Qwen3-8B to solve FrogsGame boards through tool use. FrontierSWE Mean@5 is the average solve score across up to five independent long-horizon agent runs.

Top models (higher is better)

ModelScore
Claude Fable 534.0
Grok 4.53.4
Opus 4.83.0
GLM-5.22.4
GPT-5.42.0
Composer 2.51.4
GPT-5.51.4
Opus 4.61.0
Opus 4.71.0
DeepSeek-V4-Pro0.4
GLM-5.10.4
Kimi K2.60.4
Gemini 3.1 Pro Preview0.0
Kimi K2.50.0
Qwen3.6 Plus (2026-04-02)0.0
Loading Atlas data…