机器人学长期面临一个核心痛点:视觉感知与运动规划长期处于“脱钩”状态,先看后动、各自为政。蚂蚁集团旗下Robbyant团队发布的LingBot-VA 2.0,以首个从零预训练的因果视频-动作模型,试图终结这一割裂局面。
作为首个原生具身基础模型,LingBot-VA 2.0的技术突破体现在架构设计层面。该模型采用因果DiT(Diffusion Transformer)架构,将世界状态与动作统一在同一个隐空间中进行建模。这一决策的战略意图明确:过往的具身模型往往将“视觉理解”与“动作生成”视为两个独立任务,再通过后处理耦合。而LingBot-VA 2.0则通过因果序列建模,让动作生成能以视频状态为条件,在时序上实现真正的一体化推理。
从参数配置看,模型视频专家部分约13.0B参数(约1.9B激活),总训练规模约15.3B参数,推理时每token约2.5B激活。这种“大训练、小推理”的设计思路,在保持模型容量的同时,显著降低推理成本。更关键的是,团队引入多块预测(MCP)机制,实现了2.3倍的训练加速;而前瞻推理则将推理延迟压低至142ms/chunk,异步推理频率达到225Hz。这一指标对比同行常见模型已具备竞争优势,意味着模型能实时响应环境变化,满足高动态场景的部署需求。
从评测结果看,在RoboTwin 2.0的50个任务上,LingBot-VA 2.0在干净演示数据上的平均成功率为93.8%,在随机演示数据上的平均成功率达到93.4%。两者差距极小,展现出模型对不同环境条件的鲁棒性。值得一提的是,这是首个从零开始预训练的因果视频-动作模型,而非基于现有语言或视觉模型的微调版本。这种原生化设计,使模型能在动作空间中挖掘更本质、更通用的控制策略。
对于需要部署物理机器人的开发团队而言,LingBot-VA 2.0提供了一条值得深入研判的技术路线:将视觉与行动在因果框架内统一建模。这一思路的溢出效应不仅限于实验室测试,更可能对工业场景(如柔性制造中的实时装配)、服务场景(如动态避障的移动机器人)产生直接推动。由于模型已开源,开发者可以基于此做进一步的领域迁移和微调,降低从零训练的门槛。
从更广的产业视角看,LingBot-VA 2.0的成功验证了“因果视频-动作模型”的有效性,也为具身智能基础模型的发展指明了一个明确方向:统一而非割裂,原生化而非拼凑。这一趋势有望在未来12-18个月内,推动更多团队在类似范式下进行垂直场景的适配与创新。