具身智能领域正经历一场“底层基础设施”的范式转移。全球首个面向具身智能的MoE视频生成基础模型LingBot-Video,由蚂蚁灵波科技正式开源。这一模型的核心突破,在于用极低的推理成本,构造了一个能够生成符合物理规律的机器人视频基座。
从技术架构看,LingBot-Video的总参数量为30B,但借助混合专家模型(MoE)架构的稀疏激活特性,其在推理阶段仅激活约3B参数。这意味着,与同规模Dense架构相比,其计算效率提升了约3倍。这种“大容量,小开销”设计,直接降低了模型本地部署和微调的门槛,让具身智能研究团队无需仰赖庞大的算力集群,即可在消费级GPU上进行实验。
LingBot-Video的独特竞争力还在于训练数据的构成。模型引入了涵盖视觉-语言-动作(VLA)、视觉-语言导航(VLN)、第一人称视角(Ego)等7万小时机器人专属数据。传统的视频生成模型多依赖互联网视频,对于物理世界中的重力、摩擦、惯性等动态规律缺乏“感知”。蚂蚁灵波团队为此设计了多维强化学习奖励系统,将物理合理性与任务完成度作为显式训练约束,倒逼模型输出与真实物理世界对齐的运动轨迹。
评测结果验证了这一策略的有效性。在专注于机器人交互能力的RBench上,LingBot-Video以0.620的总分超越了Wan2.6等知名模型;而在Physics-IQ Verified物理合理性专项评测中,其结果更是位居榜首。这表明,模型不仅“看懂了”视频,更“理解了”背后的物理因果关系——这是构建世界模型的关键能力。
对于开发者而言,LingBot-Video提供的直接价值包括:机器人动作预测(从当前帧推断未来几秒的动作序列)、仿真数据生成(低成本生成多样化的训练场景以解决数据分布不均问题)。在具身智能领域,高质量仿真数据生成的“数据飞轮”效应,一直是制约算法泛化能力的瓶颈。LingBot-Video的开源,可能使中小型团队在机器人基础模型研究上实现“弯道超车”。
趋势层面,LingBot-Video的发布标志着两大技术方向正在交汇:一是多模态大模型的MoE化以降低边缘部署门槛,二是视频生成从内容创作走向物理仿真。对于从业者,建议尽早基于该模型开展动作预测和仿真数据管线的验证实验。当推理成本不再构成障碍,物理世界的新一代智能体将加速到来。