当具身智能领域仍在探索如何让机器人“看懂”并“生成”环境时,小米刚发布了一个值得关注的开源模型——Xiaomi-Robotics-U0。这是一个拥有380亿参数的多模态自回归模型,其核心思路是将具身生成视为基础图像与视频生成的延伸,从而首次在大模型层面统一了文生图、图像编辑、具身场景生成、具身迁移以及具身视频生成。这种做法打破了以往各任务独立建模的碎片化格局,为机器人从感知到执行的闭环提供了新的可能性。
该模型并非简单拼凑。在架构上,它采用统一的自回归范式,将多种输入模态(文本、图像、机器人状态序列)编码为连续表征,再通过因果解码生成对应的视觉或动作输出。关键创新在于结构化可控具身迁移——模型不仅能生成静态场景,还能将源场景的物体布局、拓扑关系映射到目标机器人的运动空间,实现跨形态的行为泛化。这意味着同一套模型可同时支持轮式、双足、机械臂等多种机器人形态,无需针对每种形态单独训练。
性能数据更具说服力。在人类评估中,该模型在具身场景生成与迁移任务上超过了GPT-Image-2.0;在World Arena具身视频生成排行榜上排名第一。更值得关注的是其在真实世界操控任务上的贡献:它以38B参数作为视觉基础模型,将pi_0.5(原成功率36.9%)的分布外成功率提升至63.2%——提升幅度高达26.3个百分点。这表明统一生成模型不仅提高了生成质量,还能作为视觉特征提取器显著增强下游策略的泛化能力。
从行业背景看,当前具身智能的主流路径仍是分离式:视觉感知用预训练ViT,动作生成用扩散策略,场景编辑则依赖传统图形学管线。这种分工虽然成熟,但跨场景、跨形态的迁移效率低。小米此次开源的全栈统一模型,实质上是在尝试建立一种“生成即理解”的范式:模型能生成什么样的场景,就意味着它对场景的结构、物理约束和机器人关节限位有了深层表征。这一思路与Google的RT-2、微软的Embodied Chain of Thought不谋而合,但小米在参数规模(38B)和任务覆盖宽度上更为激进。
当然,380亿参数带来的部署成本不可忽视。不过,该模型的开源(包括代码与检查点)为社区提供了低门槛复现和二次开发的入口。对于从事具身智能研发的团队,建议重点关注两点:一是将其作为跨形态场景生成的基础工具,快速合成多样化训练数据;二是利用其结构化迁移能力,在仿真环境中生成与真实机器人类似的布局,减少sim-to-real gap。可以预见,随着更多类似“统一生成模型”的出现,机器人从“感知-规划-执行”的多阶段串联将逐步转向端到端生成式学习。