标题:LingBot-VLA 2.0开源:6B参数统一20种机器人动作,跨实体策略模型新标杆
摘要:蚂蚁集团旗下Robbyant发布LingBot-VLA 2.0,基于Qwen3-VL-4B架构,融合MoE动作专家与55维规范向量,实现跨20种机器人平台的动作统一。模型以60,000小时混合训练数据(含50,000小时机器人轨迹与10,000小时第一人称人类视频)为支撑,在GM-100基准测试中超越π0.5,全套代码及权重以Apache-2.0开源。
机器人领域的视觉-语言-动作(VLA)模型正从单任务的“实验室玩具”转向支撑跨平台泛化的基础能力。当业界仍在为不同形态机器人间的动作表征差异苦恼时,蚂蚁集团旗下Robbyant带来的LingBot-VLA 2.0给出了一套值得深入拆解的开源方案——一个拥有60亿参数、覆盖20种机器人配置的通用策略基础模型。
该模型最核心的工程突破在于对“动作统一”的处理。LingBot-VLA 2.0并未采用传统方案中针对每类机器人定制输出空间的做法,而是设计了一套55维规范向量,将不同机器人的关节角度、末端执行器位姿、夹爪状态等异构信息映射到同一抽象空间。这使得模型在训练阶段能同时吸收来自轮式底盘、四足、双臂协作等多种形态的数据,无需单独为每种机器人生成专属动作头。
在架构设计上,LingBot-VLA 2.0以Qwen3-VL-4B-Instruct作为视觉-语言骨干,并叠加了MoE(混合专家)动作专家模块。不同于简单拼接视觉与动作预测的端到端设计,MoE架构允许模型针对不同动作类型(如连续关节控制、离散夹爪指令)路由到专门的专家子网络,同时保持主干参数的共享。这一设计显著降低了模型在面对多任务、多形态数据时的知识冲突,也是其在GM-100双机械臂基准测试中,在多个机器人平台(如固定基座、移动机械臂)上超越π0.5及前代版本的关键原因。
数据规模和质量是另一个决定性的变量。LingBot-VLA 2.0的训练数据集总量达到约60,000小时,其中50,000小时来自机器人轨迹(涵盖20种机器人实物与仿真数据),另外10,000小时为第一人称人类操作视频。值得注意的是,人类视频数据并非简单的“填充”,而是通过动作映射算法将其中的手部运动对应到规范向量空间,从而为机器人提供更丰富的物体交互示范。这种做法在降低数据采集成本的同时,也拓宽了模型对未见过场景的适应能力。
从行业视角看,LingBot-VLA 2.0的开源动作(Apache-2.0许可)直指当前机器人智能的核心痛点:跨实体泛化。此前,π0.5等同类模型虽表现优异,但多在商业许可下发布,对学术团队和中小企业并不友好。Robbyant将完整模型权重、训练代码以及技术报告公开,意味着团队可以直接基于该模型进行微调,绕过了从零构建统一动作表示的难题。对于正在搭建机器人基础模型的研究者,MoE动作专家架构是值得重点复现的设计;而对于产品团队,55维规范向量提供了一个可直接移植的“动作接口”标准。
未来的挑战依然存在:60,000小时数据对于覆盖真正多样化的工业场景仍显不足,尤其是极端环境下的长尾操作;MoE模块的推理效率也需要在实际部署中进一步优化。但LingBot-VLA 2.0的推出无疑将加速机器人策略从“单具身演示”向“多具身共享”的转变——这恰是通往通用机器人智能必须跨过的门槛。