巅峰77%,机器人编程终现“自我进化”:ASPIRE如何打破数据桎梏

机器人编程的长期困境在于:每一次任务都像从零开始。即便顶级模型能在特定场景取得高成功率,一旦任务复杂化、环境变化,性能便急剧坍缩。LIBERO-Pro平台上,此前最优秀的方法在长任务上的成功率徘徊在4%附近,几近“不能工作”,这折射出具身智能领域“泛化性”与“复杂性”之间的根本矛盾。

针对此,NVIDIA联合密歇根大学、UIUC和UC Berkeley提出的ASPIRE框架,正试图从根本上改变这一范式。核心不是“训练一个更好的模型”,而是设计一套持续学习系统——让机器人学会像人一样,把每次失败都变成下一次成功的基础。

ASPIRE的架构由四个关键组件构成:编程智能体(Coordinator)、闭环执行引擎(Executor)、技能库(Skill Library)和进化搜索(Evolutionary Search)。其中,编程智能体基于Claude Code(Claude Opus 4.6,配备1M token上下文窗口)生成初始控制程序;闭环执行引擎则实时监测任务执行状态,一旦失败即激活进化搜索机制,对程序进行自动调试和优化;调试后的成功方案被沉淀为“技能”存入技能库,供后续任务复用。

这种设计的精妙之处在于,每一次失败都不是终点,而是技能库的一次“数据增广”。在LIBERO-Pro基准上,ASPIRE最高比最强基线提升77个百分点;Robosuite双手交接任务,成功率从20%跃升至92%;BEHAVIOR-1K收音机拾取任务也由56%提升至88%。这些数字背后,是一条清晰的逻辑链:单次编程无法应对复杂环境,但“编程+闭环优化+经验积累”的组合可以。

更具启发的成果体现在零样本长任务上。ASPIRE利用LIBERO-90任务积累的技能库,在LIBERO-Pro Long任务上达到了约31%的成功率,而此前所有方法都饱和在4%附近。这7倍的提升,意味着机器人终于开始展现出“学以致用”的潜力——它不需要为每个新任务从零训练,而是从已有经验中检索、组合和适配。

面向未来,ASPIRE的架构思路很可能成为具身智能落地的新范式。当前行业焦点集中在规模更大的训练数据和更强的基座模型上,但ASPIRE提示我们:在数据稀缺、任务异构的机器人场景中,系统的学习效率比模型的天花板更重要。结合NVIDIA此次选择Claude而非自研模型来驱动编程智能体,也释放出一个信号:未来的机器人框架将更加开放和模块化,各环节各取所长。

对于正在探索机器人应用的企业,建议关注两个方向:一是将“失败实验”数据系统化,使其成为技能库的养料;二是在模型选择上保持灵活,专注于架构设计而非自研基座。ASPIRE最核心理念完全可借鉴:不要试图一次性写好所有代码,而是让机器学会自己改进。