MoE加持30B参数仅激活3B:灵波开源视频基模成具身智能新范本

具身智能行业长期面临一个结构性矛盾:高质量、多模态、物理一致性的机器人训练数据极度匮乏,而基于视频的仿真数据生成又受制于高昂的算力成本与模型能力天花板。这一困局在LingBot-Video发布后,或许找到了新的解法。

蚂蚁灵波科技正式开源 LingBot-Video,这是全球首个基于混合专家架构(MoE)、面向具身智能的视频生成基础模型。该模型总参数量高达30B,但在推理时仅需激活约3B参数。这不是简单地在与Dense架构比拼大小,而是通过稀疏化激活机制,将计算效率提升了约3倍——换言之,同等算力条件下,研究者可以运行更多轮次、生成更长的视频序列,或直接降低物理部署中的GPU占用量。

从数据策略来看,LingBot-Video并未止步于互联网规模的人类视频预训练。它专门引入了超过7万小时的机器人原生数据,包含视觉-语言-动作(VLA)、视觉-语言-导航(VLN)以及第一人称视角(Ego)等细分维度。这一定位使其具备直接理解机器人本体运动规律与任务意图的能力,而非仅仅停留在生成好看的“视频画面”层面。更为关键的是,模型引入了一组多维度强化学习奖励系统,从物理合理性(如重力、碰撞、关节角度限制)和任务完成度(如抓取成功、目标到达)两个方向进行对齐,让生成的视频片段不再是“人工幻觉”,而是可级联进入真实机器人执行链路的有效训练数据。

在权威评测集RBench上,LingBot-Video以总分0.620的评估结果超越了Wan2.6等一系列模型,在Physics-IQ Verified物理合理性测试中,它排名第一。这类结果意味着:模型所生成的机器人运动视频,在遵循物理规则方面,已经达到了目前开源方案的领先水平。对于机器人动作预测、目标驱动行为的仿真数据生成等需强因果推理的任务,LingBot-Video提供了扎实的备选方案。

行业观察者指出,该模型的特殊价值在于两个层面。其一,它为世界模型领域提供了真正可落地的“视频基座”。过去,大多数开源视频模型聚焦于文生视频的创意效果,缺乏对物理规律和机器人空间的显式编码。其二,通过开源策略,蚂蚁灵波实际上在降低整个具身智能生态的入门门槛——团队无需从零训练大模型,可直接基于LingBot-Video做微调或串联,用于下游仿真器或跨具身任务策略的迁移学习。

对于正在摸索具身智能落地的研究与工程团队而言,一个实用建议是:直接从仿真数据生成和策略迁移测试这两个方向入手。利用MoE架构的推理成本优势,你可以在不影响物理算力预算的前提下,扩大合成数据池的规模和多样性。同时,结合已有的VLA策略网络,LingBot-Video也可作为闭环训练中的世界模型激励器,评估执行动作后的预期场景变化。从“所见”到“所动”,这一环节链条的补齐,或将加速具身智能从论文走向机器人真机操作台的进程。