ASPIRE机器人框架:零样本成功率飙升77点,编程进化为持续学习

机器人编程长期困于“一次性”模式:针对特定任务手写控制逻辑,一旦环境或目标变化,代码便失去效用,大量失败调试经验随之流失。NVIDIA联合密歇根大学、UIUC、UC Berkeley等机构提出的ASPIRE(Autonomous Self-Improving Robot Framework with Evolutive Programs)框架,试图打破这一僵局——它将机器人编程从静态代码撰写转变为动态持续学习过程。

ASPIRE的核心是“协调器-执行器”架构。协调器负责解析任务目标、调度技能,执行器在闭环控制中实时调整动作。框架引入技能库概念,将成功与失败的执行经验抽象为可复用的代码模块;搭配进化搜索机制,自动探索控制程序的最优组合。值得一提的是,其编程智能体基于Claude Code(搭载Claude Opus 4.6模型,支持百万token上下文窗口),能够理解长达数十分钟的机器人运行日志并进行针对性修改。

实验数据展现了该框架的实质性突破。在LIBERO-Pro基准上,ASPIRE较最强基线最高提升77个百分点;Robosuite双手交接任务成功率从20%跃升至92%;BEHAVIOR-1K收音机拾取任务从56%提升至88%。更值得关注的是零样本泛化能力:利用LIBERO-90积累的技能库,ASPIRE在未见过的新长序列任务(LIBERO-Pro Long)上达到约31%的成功率,而此前所有方法均饱和在4%附近。这意味着调试经验被有效沉淀,而非丢弃。

这一思路的价值远超数字本身。传统方法依赖人工调参或强化学习海量试错,而ASPIRE通过将失败调试结构化,让机器人在每一次执行后都能“学到”如何改进代码,类似于人类程序员的迭代思维。从行业背景看,大语言模型(如GPT-4、Claude)已经能生成单次可用的机器人控制脚本,但面对复杂长程任务或未知环境时迅速崩溃。ASPIRE恰好填补了“生成-验证-修正”闭环中的自动化短板。

展望未来,ASPIRE框架暗示了机器人软件栈的演进方向:从“一次编写到处调试”转向“持续积累能力库,零样本适配新任务”。对于机器人开发者,关注此类自我改进框架的意义在于,它可能大幅降低长尾场景的部署成本——当机器人能够自主修复失败策略,人工干预将集中在高价值决策层。可以预见,随着技能库的积累和基础模型能力的提升,零样本机器人将在仓储、家庭服务等场景中加速落地。