MiMo-V2.5
Xiaomi · 2026-04-22 · 310.8B parameters
MiMo-V2.5 is Xiaomi's native omnimodal sparse-MoE model, combining a MiMo-V2-Flash-derived language backbone with dedicated vision and audio encoders to accept text, images, video, and audio. Xiaomi reports approximately 310B total and 15B activated parameters, approximately 48T training tokens, a 5:1 hybrid sliding-window/global-attention backbone, a context window extended to 1M tokens, and post-training with supervised fine-tuning, agentic reinforcement learning, and Multi-Teacher On-Policy Distillation.