机器人编程长期困在“一次编写、静态执行”的窠臼里:开发者手工调参、反复重写,一旦环境稍有变化,代码便失效。NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出的 ASPIRE(Adaptive Skill Programming with Iterative Refinement and Evolution) 框架,正试图打破这一僵局——它将机器人程序编写从单次尝试转变为持续学习系统,核心是让机器人在失败调试中积累可复用技能,而非每次都从零开始。
ASPIRE 的架构可拆解为四个核心模块:协调器-执行器 负责高层任务分配与底层动作解耦;闭环执行引擎 实时监控执行状态并触发重试或切换策略;技能库 存储已验证成功的原子技能(如“抓取”“放置”“旋转”),并附带上下文参数;进化搜索 则在技能组合空间中自动迭代,寻找最优动作序列。编程智能体基于 Claude Code(Claude Opus 4.6,1M token 上下文窗口),这意味着模型能一次性处理整个机器人轨迹日志与参数文件,而非仅查看几行报错信息。
在三大机器人基准上的表现验证了这一思路的有效性。在 LIBERO-Pro 上,ASPIRE 的最高成功率比最强基线(如 RVT2、ACT)高出 77 个百分点,此前多数方法在 长任务(10 步以上)上已陷入停滞。在 Robosuite 双手交接 任务中,成功率从基线方法的 20% 跃升至 92%,关键在于框架能通过闭环执行及时修正双手配合的位姿误差。更令人关注的是 BEHAVIOR-1K 收音机拾取 任务——从 56% 提升至 88%,其中“进化搜索”策略贡献了 13 个百分点的增益,而单纯靠更大的模型或更多数据难以实现如此幅度的跨越。
最具有启发性的是 零样本长任务泛化 结果。ASPIRE 利用在 LIBERO-90 上积累的技能库,直接在 LIBERO-Pro Long 任务上执行,成功率约 31%。而此前所有方法(包括 RVT2 等大模型基座)都在 4% 附近饱和——差异并非来自模型能力,而是缺乏系统化的技能复用机制。传统方法在遇到未见过步骤时只能报错退出,ASPIRE 则能从技能库中调用语义近似的原子动作并调整参数,实现“开箱适应”。
从行业视角看,ASPIRE 代表的趋势值得关注:机器人泛化不再仅依赖更大的训练数据集或更复杂的端到端模型,而是转向“以策略为核心、以执行反馈为燃料”的自我改进范式。技能库的设计让每一次任务执行都成为知识的沉淀,而非一次性的消耗。对于机器人开发者而言,这意味着:与其追求一个“万能大模型”,不如构建一套能从错误中学习、能自动检索并组合已有技能的开放系统。ASPIRE 目前仍依赖强语言模型作为编程智能体,推理成本较高,但其架构思路——闭环执行+历史技能复用——很可能成为下一代机器人操作系统的标准组件。毕竟,人类从不奢望一次学会所有动作,机器人也应该如此。