蚂蚁灵波开源LingBot-Video:30B参数用3B,低成本驱动具身智能

具身智能行业正从“模型竞赛”迈向“成本竞赛”。蚂蚁灵波科技正式开源了全球首个基于MoE(混合专家)架构、面向具身智能的视频生成基础模型——LingBot-Video,其核心价值在于用极低的推理开销,押注“物理世界理解”这一关键赛道。

模型总参数达到30B,但在推理时,得益于MoE架构的稀疏激活特性,仅激活约3B参数。这一设计直接回应了机器人领域一个长期痛点:高精度模型往往伴随着高昂的算力成本,难以在边缘设备或机器人本体上实时运行。LingBot-Video将同等规模Dense架构的推理效率提升了约3倍,使“在机器人的计算前端跑视频基模”成为可能,而非只是云端demo。

在数据与训练层面,LingBot-Video不盲目追求常识视频的“宏大叙事”,而是聚焦机器人执行任务时的“目光”。模型引入了7万小时的视觉-语言-动作(VLA)、视觉-语言-导航(VLN)以及第一人称视角(Ego)数据。这些数据是机器人完成任务、理解自身与环境交互的“母语”,而非互联网上杂乱的风景或对话视频。通过多维强化学习奖励系统,模型被训练来对齐物理合理性与任务完成度,即生成的视频不仅要“看着像真事”,更要“在物理上能跑通”。

评测结果印证了这一路线的有效性。在面向机器人任务的RBench上,LingBot-Video总分达到0.620,超越了包括Wan2.6在内的多个通用视频生成模型;在专门考验物理常识的Physics-IQ Verified排行榜上,它更是摘下第一。这意味着,模型在“杯子是否会掉落”“机器人抓手闭合轨迹是否合理”等对机器人仿真至关重要的微观物理场景上,建立了优势。

从行业视角看,这是继语言大模型开源、视觉大模型开源后,“机器人世界模型开源”浪潮的一次实质推进。此前,具身智能研究者若想获得高质量仿真数据,要么依赖于昂贵的真实机器人采集,要么受限于物理引擎无法精细模拟的合成数据。LingBot-Video开源后,开发者可直接利用该模型生成机器人动作预测的训练数据,或将其作为世界模型进行“预演”,极大地降低了实验的试错成本。

在具身智能从“烧钱拼参数”转向“落地拼效率”的节点上,LingBot-Video提供了一个高性价比的基座。下一步,生态竞争的关键不在于谁能做出更庞大的模型,而在于谁能在有限算力下,让机器人“看懂”更多物理规则,并以此生成更精准的行动指令。对正寻找开源工具切入具身智能的团队而言,LingBot-Video已发出信号:MoE不是路线之争,而是成本之选