NVIDIA联合多校提出ASPIRE:机器人自我进化,零样本成功率飙77点

机器人编程长期困于“一次性尝试”的窠臼——开发者为特定场景编写控制代码,环境稍有变化便需从头调试。NVIDIA与密歇根大学、UIUC、UC Berkeley联合提出的ASPIRE框架彻底打破了这一逻辑:它不再把机器人编程视为静态任务,而是将其转化为一个持续自我改进的闭环过程

ASPIRE的核心架构包含协调器、闭环执行引擎、技能库和进化搜索四个模块。协调器通过Claude Code(即Claude Opus 4.6,具备百万token上下文窗口)充当编程智能体,理解任务目标和环境反馈,自动编写并迭代控制程序。闭环执行引擎在机器人实际运行时捕捉失败轨迹,将其送入进化搜索模块;后者基于失败案例生成程序变体,并在模拟器中验证,最终将成功方案写入可复用的技能库。后续遇到类似任务时,协调器可直接从技能库中检索、组合已有程序,实现零样本迁移。

这套机制的效果在多个基准测试中得到验证。在LIBERO-Pro场景中,ASPIRE比最强基线最高提升77个百分点;在Robosuite双手交接任务上,成功率从20%飙升至92%;在BEHAVIOR-1K的收音机拾取任务中,成功率从56%提升至88%。更值得关注的是其在零样本条件下的表现:利用从LIBERO-90积累的技能库,ASPIRE在LIBERO-Pro Long长任务上达到约31%的成功率,而此前最优方法仅饱和在4%附近。这意味着,ASPIRE不仅能高效解决单个任务,还首次展示了机器人将过去经验转化为未来能力的可行路径。

从行业背景看,现有的机器人学习方案大多依赖大规模数据采集或强化学习,前者消耗大量人工标注,后者在复杂长任务中易陷入局部最优。ASPIRE另辟蹊径——利用大语言模型的编程能力替代人工规则设计,再通过失败反馈驱动自动纠错,本质上是一种“任务级自动化编程+闭环验证”的混合范式。其突破不在于单个任务的绝对数字,而在于证明了机器人可以从一次一次失败中系统性地积累常识,将单次调试沉淀为可复用的知识资产。

展望未来,ASPIRE的局限也很明显:当前技能库仍依赖模拟器中预先设计的任务集,且进化搜索的计算成本较高。但其核心思路——让机器人每一次失败都变成一次学习机会——对于行业具有标志性意义。当机器人能够自主积累技能并用于未见任务,机器人从实验室走向现实的生产力瓶颈将逐步被打破。对于机器人开发者而言,关注点不应仅限于算法精度,而应转向如何构建持续学习的底层架构,让机器人学会“犯错-反思-复用”的闭环能力。