小米开源380亿参数模型,统一具身生成与操作,真实世界成功率提升72.7%

具身智能正走向一个关键的十字路口:谁能在统一框架中既能生成高质量的场景与轨迹,又能在真实机器人上完成精准操控,谁就掌握了通往通用机器人的钥匙。小米新发布的Xiaomi-Robotics-U0给出了自己的答案——一个380亿参数的多模态自回归模型,首次将文生图、图像编辑、具身场景生成、具身迁移以及具身视频生成整合进单一框架,并在多个维度达到SOTA。

核心事实:这个380亿参数的模型在具身场景生成与迁移的人类评估中,击败了GPT-Image-2.0,展现了跨多种机器人形态的高质量多视角场景生成能力。更令人关注的是,在World Arena具身视频生成排行榜上,它直接登顶第一。但最硬的指标来自真实世界:在真实机器人操控任务上,它把基线模型pi_0.5的分布外成功率从36.9%拉到了63.2%,提升了72.7%。这不是模拟器中的“作秀”,而是物理世界中的硬实力。

它的创新在于一个关键洞察:将“具身生成”视为基础图像与视频生成的逻辑延伸。传统上,场景生成、视频生成、机器人控制分属不同研究社区,各自为战。小米U0统一了这些任务的空间表征与训练目标,本质上是用一个模型同时理解“环境应该长什么样”和“机器人应该怎么动”——这种统一范式直接继承了Transformer在序列生成上的泛化能力,同时借助380亿参数带来的容量,容忍了不同任务间数据分布的巨大差异。

这种统一并非简单拼接。U0引入的结构化可控具身迁移机制,使得模型在生成跨形态异构机器人的动作时,能够保持场景与目标的一致性。也就是说,同一个环境模型,既可用于四足机器人行走,也可用于机械臂抓取,无需额外适配。这大大降低了具身智能系统在不同硬件上迁移的门槛。

小米U0的发布并非孤立事件。它反映了行业对“通用具身基础模型”的深度追求。此前,各厂商倾向于专精方向:有的专攻场景理解,有的聚焦操作策略。U0证明了一个方向:当模型容量足够大、训练数据足够丰富时,通过自回归方式将所有生成与操控任务统一在一个Token空间中,不仅可行,而且能带来正向跨任务迁移。三个核心差异值得关注:一是从单任务专用走向多任务统一;二是从模拟器验证走向真实世界物理提升;三是从闭源自用走向开源生态。

对于从事具身智能研究与开发的从业者,小米U0提供了三个实用抓手:第一,开源代码与检查点意味着可以立即复现与微调,降低了从零训练380亿模型的门槛;第二,其“生成即操控”的框架为构建机器人数据生成管道提供了新范式——可以先用U0生成场景与动作,再用生成的轨迹数据训练下游策略;第三,67%的真实世界成功率提升直接指向实际部署价值,而不仅仅是学术指标的提升。

从更广阔的视角看,小米U0的意义或许不逊于今年年初的Stable Diffusion对图像生成领域的冲击。它标志着具身智能正从“专才”走向“通才”,从零散的单点突破转向系统级的框架统一。如果把GPT时刻引申到机器人领域,U0可能正是那个“全能起点”。接下来要观察的关键问题是:统一框架带来的收益能在多大比例地覆盖不同机器人的物理差异,以及开源生态下的社区贡献能否将它推向更高的通用化水平。无论如何,U0给这轮具身智能竞赛设定了一个值得被追赶的新基线。