Atlas

Benchmarks

← All benchmarks

Step Game TrueSkill Mu

Games · 2025-06-06

Lech Mazur's Multi-Agent Step Race benchmark evaluates models in a public-talk, private-move game where collisions prevent players from advancing. The public leaderboard reports TrueSkill mu as the headline measure of collaboration and deception under pressure.

Top models (higher is better)

ModelScore
GPT-55.5
o35.3
GPT-5.15.3
Gemini 3 Pro Preview5.0
O14.1
Gemini 2.5 Flash4.0
Gemini 2.5 Pro3.8
Grok 4.1 Fast3.8
Gemini 2.5 Pro Preview 03-253.7
DeepSeek-V3.2-Exp3.7
o3-mini3.6
DeepSeek-V3.13.6
Grok 43.5
Sonnet 4.53.4
Kimi K2 Thinking3.3
Grok 3 Mini3.2
DeepSeek-R1-05283.2
QwQ-32B3.2
DeepSeek-R13.2
Opus 4.53.2
Opus 4.13.1
Qwen3-235B-A22B3.1
Sonnet 43.1
GPT-5 Mini2.8
Claude 3.7 Sonnet2.8
O4 Mini2.6
Qwen3 235B A22B Instruct 25072.5
o1-mini2.4
Opus 42.4
Gemini 2.0 Flash Thinking Experimental 01-212.3
GLM 4.62.2
Qwen3-30B-A3B2.2
GLM-4.51.7
Claude 3.5 Sonnet (Oct 2024)1.7
gpt-oss-120b1.6
ChatGPT-4o Latest observed 2025-03-271.6
Qwen3-Max-Preview (Thinking Mode)1.5
Gemini 2.0 Pro Experimental 02-051.4
Qwen2.5-Max1.4
Mistral Medium 3.11.4
Loading Atlas data…