标题:30B参数仅激活3B,蚂蚁灵波开源全球首个具身智能MoE视频基模
摘要:蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于混合专家架构(MoE)的具身智能视频生成基础模型。模型总参数30B,推理时仅激活约3B,推理效率较同规模稠密架构提升3倍。结合强化学习与多维奖励系统,该模型在RBench评测中以0.620总分超越Wan2.6等竞品,并在Physics-IQ Verified中排名第一。
具身智能领域正迎来关键基础设施的突破。蚂蚁灵波科技宣布正式开源其视频生成基础模型LingBot-Video,这也是全球首个基于混合专家架构(MoE)的具身智能视频基模。此举标志着大模型开源社区在机器人仿真、世界模型构建等方向获得了可落地的技术工具。
该模型采用MoE(混合专家)架构,总参数量达30B,但推理时仅激活约3B参数,效率较同等规模的稠密模型提升约3倍。这种“大容量、小激活”的设计思路,使得高性能视频生成模型得以在更具性价比的计算资源下运行,降低了对大规模算力集群的依赖,降低了具身智能研究的硬件门槛。
在模型训练数据层面,LingBot-Video引入了超过7万小时的机器人相关数据,涵盖VLA(视觉-语言-动作)、VLN(视觉语言导航)、Ego(第一人称视角)等模态。这样的数据组合,直接服务于具身场景下的物理行为建模与任务执行逻辑理解。进一步,模型通过多维强化学习奖励系统对输出进行优化,从而在视频生成中维持物理合理性、动作连贯性以及任务完成度的稳定对齐。
评测表现上,LingBot-Video在RBench数据集上获得0.620的总分,击败了包括Wan2.6在内的一众同类模型;在Physics-IQ Verified评测中更是排名首位。这一成绩反映了模型在真实物理规则还原和动作预测一致性上的显著优势。
从应用角度看,LingBot-Video可直接用于机器人动作预测、仿真数据生成等关键环节。对于缺乏大量真实机器人训练数据的研究团队而言,利用该模型生成高质量的合成视频数据进行数据增强,是低成本的替代路径。同时,它也具备作为世界模型前驱组件的潜力,有助于推动从“指令到视频”到“视频到行为”的闭环演进。
具身智能赛道愈发拥挤,但高质量的开源视频基模仍是稀缺资源。如果说此前行业主要依赖通用视频生成模型做“降级适配”,LingBot-Video的推出则代表了“从0到1”做出针对性设计。对于正在攻关机器人策略学习或仿真环境的团队来说,这无疑是一份值得即刻试跑的高质量工具。
LingBot-Video现已正式开源,相关仓库地址与模型参数已公开。对于希望搭建自己的具身智能世界模型或数据生产管线的开发者,这或许是最快捷的启动点。