具身智能领域正经历从“视觉感知+策略微调”到“原生视频-动作联合建模”的关键跃迁。蚂蚁集团旗下具身智能团队Robbyant发布的LingBot-VA 2.0,正是这一趋势的最新注脚。作为首个从零预训练的因果视频-动作基础模型,它不再依赖已有的图像或视频预训练权重,而是直接在因果DiT(扩散Transformer)架构下,将世界状态与机器人动作压缩进统一的隐空间,为机械臂操作任务提供端到端的行动先验。
该模型的架构设计颇具野心。LingBot-VA 2.0采用因果DiT骨干,视频专家分支参数量约13.0B(推理时约1.9B激活),整体训练规模约15.3B参数,推理时每token仅约2.5B激活。这一参数配置在保持高容量的同时,通过稀疏激活降低了计算成本。更值得关注的是其“多块预测”(MCP,Multi-Chunk Prediction)机制:模型不再逐帧生成动作,而是同时预测多个时间步,从而实现2.3倍的训练加速。与之配合的是前瞻推理(Look-Ahead Inference),将推理延迟压缩至142毫秒/块,对应约225Hz的异步推理频率——这意味着模型在接收观测后,能在数毫秒内规划出连续的轨迹块。
性能数据验证了其在真实操作任务中的实用性。在RoboTwin 2.0基准的50个任务上,LingBot-VA 2.0在干净演示数据上的平均成功率达到93.8%,在随机演示数据上也有93.4%的成功率。两者差距极小(仅0.4个百分点),表明模型对视觉外观和背景变化的鲁棒性超出预期。与同类工作对比——例如仅用预训练视觉模型+行为克隆的基线——LingBot-VA 2.0在涉及细粒度抓取、多步操作等任务上展现出显著优势,尤其是在需要长时序依赖的场景(如“堆积木”和“餐具摆放”)中,因果DiT的时序建模能力发挥了关键作用。
从行业视角看,LingBot-VA 2.0的价值不仅在于参数规模或性能数字,更在于其统一了“世界状态”和“动作”的表示空间。此前大部分具身模型将视觉编码与策略网络分离,使用CLIP或ViT提取特征,再通过MLP或RNN预测动作,这造成了模态间的信息损耗。而LingBot-VA 2.0的因果DiT架构直接在视频序列上训练,让模型同时学习“物体如何运动”和“机器人如何行动”,从而在推理时能推理出更符合物理规律的动作序列。这种设计思路与近期Google的RT-2系列和NVIDIA的Iso-VAE不同,后者仍依赖预训练语言或视觉模型。LingBot-VA 2.0从零训练的策略,意味着其预训练数据可以完全针对具身任务设计,避免了下游微调时的领域漂移问题。
对机器人研究者而言,LingBot-VA 2.0提供了一个值得复现和对比的基线。其因果DiT的源码和预训练权重预计将开源(仓库信息已标注),这会降低团队重复造轮子的成本,同时推动具身基础模型的标准化评测。从趋势判断,这种“视频-动作联合预训练”的范式极有可能成为未来机器人基础模型的标配,尤其是当训练数据从模拟器扩展到真实场景时,因果架构对动态环境的适应能力将成为关键优势。建议读者重点关注其MCP机制在长程任务中的泛化表现,以及前瞻推理策略在低算力设备上的部署可能性——这可能是具身智能从实验室走向物流、服务等场景的核心突破点。