蚂蚁具身模型破局:LingBot-VA 2.0如何用因果DiT重塑机器人训练范式

在具身智能快速演进的当下,一个核心矛盾始终未解:机器人学习依赖海量高质量视频数据,但采集与标注成本居高不下。蚂蚁集团旗下具身智能团队Robbyant发布的LingBot-VA 2.0模型,试图从架构层面彻底打破这一僵局。

该模型的突破点在于其因果DiT(扩散Transformer)架构。与主流方法将视觉感知和动作生成分离不同,LingBot-VA 2.0首次将世界状态和关节动作统一编码至同一隐空间。这意味着,模型不再需要视频中逐帧标注的“动作标签”,而是直接从视觉序列学习动作分布,将训练数据门槛从“标注数据”降维至“原始视频”。

技术细节上,模型采用多块预测(MCP)机制,将传统逐token预测改为多步联合预测,实现2.3倍训练加速。推理阶段的前瞻推理策略则将延迟压缩至142毫秒每块,对应异步推理频率达225Hz。这一性能已接近工业机器人控制所需的实时性底线(通常要求100-200Hz控制周期),为从仿真环境迁移至物理世界提供了关键前提。

在RoboTwin 2.0基准的50个任务中,LingBot-VA 2.0在干净演示数据和随机演示数据上的平均成功率分别达到93.8%和93.4%,性能差距极小。这与以往模型在随机场景下成功率大幅下降形成鲜明对比——说明模型泛化能力并非偶然,而是结构设计使然

从产业视角看,LingBot-VA 2.0的出现指向一个明确趋势:具身智能正在从“任务定制”走向“基础模型即服务”。正如大模型改变了NLP领域的研发模式,原生具身基础模型有望降低机器人软件开发的门槛。创业公司不再需要从零训练视觉-动作模型,而是通过少量微调即可部署至不同形态的机器人本体。

当然,该模型的局限性同样值得关注。当前测试仍集中于仿真环境,物理系统的动力学差异、传感器噪声和延迟不确定性尚未被充分验证。此外,13B参数规模对于边缘部署仍属“重模型”,需要专用推理芯片或云端协同才能满足实际需求。

对机器人从业者而言,一个明确的行动建议是:关注并测试LingBot-VA 2.0的开源模型权重。团队已提供基础微调框架,从仿真环境到真实机器人的迁移学习将成为下一阶段的核心实践。若能将其与低成本传感器和更高效的量化推理结合,具身智能的“iPhone时刻”或许比预想中来得更快。