Atlas

Models

← All models

Step3-VL-10B

StepFun · 2026-01-14 · 10.2B parameters

Step3-VL-10B is StepFun's open-weight 10B-class vision-language model, pairing a 1.8B PE-lang visual encoder with an 8B Qwen3 language decoder; the complete released checkpoint contains 10,171,750,144 parameters. Released in January 2026, it targets multimodal reasoning across STEM, document understanding, and GUI interaction while using substantially less compute than much larger models.

Benchmark scores

BenchmarkScore
AA-LCR0.0
AA-Omniscience Index-59.0
Artificial Analysis Intelligence Index9.5
Artificial Analysis Omniscience Accuracy12.7
Artificial Analysis Omniscience Hallucination Rate82.2
Artificial Analysis Openness Index41.7
Capability139.2
CritPt0.0
GPQA Diamond69.0
Humanity's Last Exam (Text-Only)10.2
IFBench (Artificial Analysis)50.2
MATH-Vision76.0
MMMU Pro64.0
SciCode (Artificial Analysis)31.1
Terminal-Bench Hard5.3
τ²-bench (Telecom)16.1
Loading Atlas data…