在机器人领域,“写程序-跑实验-失败-重写”的循环已经存在数十年。绝大多数机器人控制程序仍是人工手写或参数调优。尽管大模型在自然语言和图像生成领域取得突破,但机器人编程因其对闭环执行、物理反馈和持续迭代的苛刻需求,依然是一片尚未被攻克的“砖墙”。
NVIDIA 研究团队联合密歇根大学、UIUC 和 UC Berkeley 在这一方向迈出关键一步,提出开源框架 ASPIRE——一套以“持续学习”为核心理念的机器人控制系统。这个框架的核心不是让AI一次性写出完美程序,而是要让它学会自我调试、自我积累、自我进化。
ASPIRE 的架构可拆为三层:一个基于 Claude Code 的编程智能体(Coordinator),一个监控并反馈实际执行结果的闭环执行引擎(Executor),以及一个记录已解决问题步骤的技能库(Skill Library)。这套组合彻底改变了传统机器人编程的单次尝试逻辑——程序在第一次失败时不会被丢弃,而是进入进化搜索(Evolutionary Search)管道:错误被解码、片段被筛选、成功经验被固化。
结果令人印象深刻。在标准 LIBERO-Pro 任务集上,ASPIRE 相比最强基线提升高达 77 个百分点;在 Robosuite 的双手交接任务中,成功率从 20% 提升至 92%;BEHAVIOR-1K 的收音机拾取任务也从 56% 提升至 88%。更值得关注的是其零样本泛化能力:在 LIBERO-90 上积累经验后,ASPIRE 转到陌生且更长的 LIBERO-Pro Long 任务时,零样本成功率直接跃升至约 31%,而此前方法均被困在 4% 附近。这意味着技能库不是简单记忆,而是具备了跨任务迁移的抽象能力。
行业经验表明,过去几年多数机器人-语言模型结合的尝试都停留在“让LLM生成代码段”的粗糙阶段,缺少对失败原因的细化分析和系统性的优化反馈循环。ASPIRE 的三段式闭环——生成、执行、分析——正好填补了这一空白。尤其是“进化搜索”机制,它不依赖全局超参数扫描,而是将每次失败后的状态记录转化为代码层面的搜索路径,这对在真实物理环境中运行的高成本机器人试验尤为重要。
也要看到限制:当前框架依赖 Claude Code 闭源模型,大上下文窗口代价高;在未见过操作(complex manipulation)例如布料折叠等高精细度任务上还未被验证;进化搜索的计算开销在持续运行时不可忽视。但正如论文中释出的趋势数据——连续回合间的成功率增长曲线呈对数上升——一旦突破初始启动瓶颈,系统效率会逐步加速。
从行业格局看,ASPIRE 更大的启发在于重新定义了“通用性”:它不追求“一次写出所有场景的完美程序”,而是让机器人智能体学会循环利用碎片经验拼出完整解决方案。这种“以成长替代完美”的思路,或将推动机器人从少样本学习转向更安全、可控的跨任务知识复用。对于落地场景(如仓储、实验室、家庭服务)的高成本部署环境来说,这种“先上马、再自动调试”的进化逻辑,显然比追求完美的单次编程更具商业与现实意义。