蚂蚁开源VLA 2.0:60,000小时跨实体数据训练,通用机器人策略迈入新阶段

标题:蚂蚁开源VLA 2.0:60,000小时跨实体数据训练,通用机器人策略迈入新阶段

摘要:Robbyant发布开源LingBot-VLA 2.0模型,以Qwen3-VL为骨干,搭载MoE动作专家架构,通过55维规范向量统一20种机器人动作表征。6万小时混合训练数据及跨实体泛化能力,使其在GM-100基准中表现突出,为开发者提供了务实、可复用的通用机器人策略基座。

在机器人领域,视觉-语言-动作(VLA)模型正从实验室的封闭探索,走向真正可供社区调优的开源生态。Robbyant团队开源的LingBot-VLA 2.0,以6B参数、6万小时跨实体训练数据和MoE动作专家架构,将这一趋势推向新高度。这不是又一个只在特定机械臂上跑分漂亮的demo,而是一套通过数据统一、架构解耦实现跨实体泛化的实用模型。

模型的核心创新在于三管齐下的架构设计。首先,它采用Qwen3-VL-4B-Instruct作为视觉-语言骨干,确保强大的多模态感知和指令理解能力。其次,通过55维规范向量对不同形态机器人的状态、关节、末端执行器等信息进行标准化编码,使模型无需针对每种硬件单独调参即可理解动作空间。关键部件是MoE(混合专家)动作头,它根据输入激活不同的动作子网络,允许单一模型内高效处理轮式底盘、单臂、双臂乃至复合四足机器人的异构动作需求。这种“通用感知+规范动作+专家路由”的设计,大幅降低了模型迁移至新机器人的工程量。

数据策略是LingBot-VLA 2.0的另一块基石。训练数据集包含约50,000小时真实机器人轨迹数据和10,000小时第一人称人类视频,覆盖20种机器人配置。人类视频的价值在于提供丰富的物理交互和长期任务规划范例,弥补纯机器人数据在场景多样性和灵巧操作上的不足。60,000小时的数据规模,即使在大模型领域也属可观,它让模型在真实世界而非模拟器中学得稳、泛得广。

在GM-100双机械臂基准测试中,LingBot-VLA 2.0全面超越了前代版本及基准模型π0.5。更重要的是,这个性能提升不局限于单一平台,而是在多个机器人硬件上均得到验证。这验证了规范向量+MoE设计确实突破了此前VLA模型“换台机器就得重新训练”的局限。对于致力于开发家庭服务、仓储物流等多形态机器人的团队,这种跨实体能力直接降低了研发和部署成本。

对于从业者而言,LingBot-VLA 2.0的开源价值不止于下载权重。技术报告中详细说明了55维规范向量的定义方式和MoE动作头的训练技巧,这些是可以直接复用的工程经验。Apache-2.0许可的开源方式也允许商业项目自由集成和改进。下一步,模型如何在包含更多传感器(力控、触觉)和更加无序场景的Long-Tail任务中保持鲁棒性,将是社区关注的新焦点。

Robbyant的这次开源,实质上是为行业提供了一套可循的“数据-架构-部署”方法论,而不仅仅是一个模型。在通用机器人的竞赛中,谁能先拿到高质量、跨实体的数据,谁就能在这场“数据主权”争夺中占据先机。LingBot-VLA 2.0,已然为这条路径画出了一个清晰的起点。