ASPIRE框架打破机器人编程瓶颈:零样本成功率飙升77个百分点

机器人编程的长久困境在于:人工编写规则耗时且难以泛化,强化学习则数据饥渴且泛化脆弱。NVIDIA联合密歇根大学、UIUC、UC Berkeley等机构提出的ASPIRE框架,试图从根本上改变这一局面——不是让模型一次学会所有技能,而是让机器人像程序员一样,边执行边调试,并将失败经验沉淀为可复用的技能库。

ASPIRE的核心是一套协调器-执行器架构:协调器基于Claude Code(Claude Opus 4.6,1M token上下文窗口)作为编程智能体,负责规划任务、调用技能库中的子程序,并在闭环执行引擎中实时监控反馈;若执行偏离预期,进化搜索算法自动调整参数或重写代码片段。这种持续学习的机制,打破了传统机器人编程中“一次编写、永远使用”的静态模式。

实验数据给人深刻印象。在LIBERO-Pro基准上,ASPIRE比最强基线(如RT-2、MoCo等)最高提升77个百分点;Robosuite双手交接任务,成功率从20%攀升至92%;BEHAVIOR-1K收音机拾取任务,从56%提升至88%。这些数字背后更关键的是零样本泛化能力:利用LIBERO-90积累的技能库,ASPIRE在从未见过的LIBERO-Pro Long长任务上达到约31%成功率,而此前最先进方法仅停留在4%附近。长任务(通常需要10~20步操作)对当前主流模仿学习或离线强化学习仍是大难题,ASPIRE将天花板拉升了近8倍,证明“从失败中学习”的策略在机器人领域具有巨大潜力。

值得关注的是,ASPIRE并未依赖端到端视觉-语言模型,而是采取程序合成+闭环搜索的技术路线。这与当前大模型直接输出动作的范式形成鲜明对比:大模型擅长常识推理,但难以处理精确执行中的微小偏差;ASPIRE则通过迭代修正缩小了推理与执行之间的鸿沟。同时,Claude Code的1M token上下文窗口使得智能体能携带整个历史日志和技能库进行决策,避免了遗忘。

从行业趋势看,ASPIRE的设计思路可能比具体数字更具启发性。机器人进入家庭、工厂等复杂环境时,不可能预编程所有场景,而自我改进框架允许机器人“越用越聪明”。下一步的关键在于如何自动化技能库的冲突检测与合并,以及如何降低大规模进化搜索的计算开销。但无论如何,ASPIRE指明了一个方向:机器人学习不应是单次训练,而应是持续的、闭环的自我进化过程。