标题:蚂蚁团队开源6B模型LingBot-VLA 2.0:统一动作空间,跨实体机器人迈出关键一步
摘要:Robbyant团队开源LingBot-VLA 2.0,一个6B参数视觉-语言-动作基础模型。采用MoE专家架构,60,000小时跨20种机器人及人类视频数据训练,以55维规范向量统一动作表示,在GM-100基准上超越π0.5。该工作将通用机器人策略从实验室推向实际部署。
通用机器人操作长期面临一道“跨实体鸿沟”:不同机器人身上装载的摄像头位置、关节构型、动作编码方式各不相同,导致一种机器人学到的技能难以迁移到另一种硬件上。无论是工业界的机械臂还是服务领域的移动操作平台,模型往往需要在特定硬件上从头收集数据训练,这种“手工作坊”式的开发模式直接限制了机器人技术的规模化普及。
近期,Robbyant团队发布的LingBot-VLA 2.0正式向这一困境开出“药方”。这是一款以Qwen3-VL-4B-Instruct为视觉-语言骨干,搭配MoE(混合专家)动作专家架构的6B参数开源VLA模型。其核心创新在于通过一个55维规范向量,将不同机器人平台(无论是单臂轮式机器人,还是双机械臂移动平台)的状态和动作映射到统一的动作空间中。
这种统一的动作表征让模型可以消化海量异构数据。训练集包含约60,000小时高质量数据(50,000小时机器人轨迹 + 10,000小时第一人称人类视频),覆盖20种不同硬件配置(包括夹爪、吸盘、双臂等末端执行器)。相比π0.5等前沿模型主要以灵巧手或特定平台为主,LingBot-VLA 2.0在数据规模和硬件多样性上实现了质的飞跃。
在GM-100双机械臂基准测试中,该模型在多米诺、收纳、倒水等任务上均优于π0.5和上一代版本。原因在于MoE架构可以让不同专家模块各司其职:当模型需要执行精确抓取时,高保真动作专家被激活;当需要理解长程任务指令时,语言与视觉特征对齐的专家介入,模型无需在推理时做技术取舍。
从行业视角看,LingBot-VLA 2.0的发布绝非又一例实验室demo。它给出的三样东西对开发者格外有价值:第一,开源权重与代码(Apache-2.0许可)降低了二次开发的门槛;第二,55维规范向量的设计为未来跨平台数据聚合提供了标准化范本;第三,MoE架构在保持6B参数体量的同时,推理时仅激活部分专家,对边缘部署更友好。
不过也要看到,通用VLA模型仍有“最后几公里”要走。当前模型对动态环境(如光线剧变、遮挡突增)的鲁棒性尚未充分验证,且6B参数对于车载嵌入式芯片仍稍显臃肿。一个清晰的方向是:未来半年到一年,头部团队将更关注模型轻量化压缩与实机在线微调的工程落地。
对于从事机器人操作研究的团队,现在是将LingBot-VLA 2.0部署到自有平台上微调的好时机。跨实体泛化和MoE统一框架的思路,很可能成为通用机器人策略的标准范式。在这个由数据和架构共同驱动的时代,开放意味着更快的行业整体进化。