ASPIRE机器人框架:零样本成功率飙升77分,持续学习破局长任务

机器人编程长期面临一个结构性困境:单个任务的控制程序通常只能一次性编写、静态执行,一旦环境或目标发生变化,开发者不得不从头调试,而此前积累的“调试经验”往往随项目报废。这种“写一次用一次”的模式,使机器人很难像人类一样从失败中抽象出可复用的知识。NVIDIA联合密歇根大学、UIUC、UC Berkeley提出的ASPIRE框架,直接瞄准这一痛点,将机器人编程从单次任务执行升级为持续学习闭环

ASPIRE的核心是协调器-执行器架构:协调器负责理解任务语义、拆解子目标,并动态调用技能库中的原子操作;执行器则通过闭环执行引擎实时监测控制效果,一旦出现问题,进化搜索模块会自动修正程序代码,并将修正后的经验沉淀回技能库。整个流水线由编程智能体驱动,后者基于Claude Code(采用Claude Opus 4.6,配备1百万token上下文窗口)。这种设计使得机器人每次执行失败都不再是“废动作”,而是技能库的增量更新素材。

论文在三个代表性基准上给出了硬指标。在LIBERO-Pro任务集中,ASPIRE的最高零样本成功率相比最强基线提升了77分——这并非渐进式改良,而是接近翻倍的质变。在Robosuite双手交接任务中,成功率从20%跃升至92%;BEHAVIOR-1K收音机拾取任务则从56%提升至88%。更具启发意义的实验结果来自LIBERO-Pro Long长任务场景:此前所有方法在该场景下零样本成功率均饱和在4%左右,而ASPIRE利用从LIBERO-90积累的技能库,直接拉升至约31%。这一跳变表明,技能复用带来的“迁移红利”在长时序、多步骤任务中尤为显著。

值得注意的行业背景是,当前机器人领域的主流技术路径——无论是端到端模仿学习还是基于视觉语言模型的行为克隆——都受困于数据覆盖度问题:模型难以处理训练分布之外的新状况。ASPIRE选择了一条不同的道路:不试图让模型“见过所有场景”,而是让模型学会“写程序来应对新场景”,并通过执行反馈快速迭代程序。这种“代码即策略”的思路,天然具备可解释性和可编辑性。

从技术红利看,ASPIRE最大的价值在于将“零样本泛化”从实验室概念转化为可度量的工程实践。当长任务零样本成功率从4%跃迁至31%,意味着机器人开始具备“举一反三”的雏形——虽然还不完美,但范式已经清晰。对于机器人领域从业者而言,这个框架的启示在于:相比继续堆砌训练数据,构建“执行-失败-修正-复用”的闭环系统可能更接近通用机器人的核心。未来,随着技能库规模扩大和进化搜索效率提升,ASPIRE所代表的持续学习路径有望成为机器人编程的新基础设施。