随着AI智能体从概念验证走向生产部署,一个核心矛盾日益凸显:模型的上下文窗口有限,而智能体需要维护的长期记忆与技能清单却几乎无限。传统做法要么将所有技能塞入提示词导致“信息过载”,要么依靠RAG频繁检索但延迟高、决策碎片化。VC分析师Tomer Tunguz观察到的最新架构实践,恰好提供了一种优雅的解法——预检工作记忆(Pre-check Working Memory)与前向看门狗(Forward Watchdog)机制,本质上是将大模型从“全能执行者”降级为“调度中心”,在软件架构层面实现记忆管理的“高内聚低耦合”。
该架构的核心是一套约90个索引化技能库的磁盘存储体系。当查询到来时,系统不急于将全部技能灌入上下文,而是执行一次“预检”——从技能库中检索最相关的若干技能,仅将这部分加载到本地模型的工作记忆窗口。承担执行主力的是一款35B参数的本地开源模型Ornith 35B,运行在Apple Silicon(通过Ollama)上,处理约80%的常规任务(如邮件分类、日历查询)。对于需要深度推理或复杂交互的困难任务,系统通过路由机制自动转交至前沿模型(如GPT-4、Claude 3.5)。这种冷热分离策略显著降低了API成本和推理延迟,同时保持了对复杂场景的兜底能力。
真正让这套架构具备“进化”属性的,是看门狗模块。它不仅记录每一次预检阶段的决策(选择了哪项技能、为什么跳过其他技能),还在夜间通过异步推理处理全天的决策轨迹,自动判断哪些技能需要新增、哪些技能需要“固化”。例如,当日历排期类任务重复出现且模式固定时,看门狗会将其从柔性提示词逻辑转化为确定性的Rust代码,写入技能库作为永久模块。这种“经验写入代码”的自我改进循环,让系统在运行中持续压缩对模型推理的依赖,提升稳定性和效率。
值得关注的是,Tunguz在博客中提到,在近期的一次夜间评估中,看门狗首次未提出任何改进建议。这或许意味着当前技能库的覆盖率和固化程度已接近该架构的性能平台期——系统已经找到了现有任务分布下的最优技能集合。但更可能的解读是,这一机制揭示了Agent开发的工程上限:当架构层面的“记忆-调度-固化”循环达到均衡后,进一步的性能提升需要回到模型能力或技能库的广度上,例如引入多模态技能或跨域推理。
对于正在构建生产级Agent的开发者,这一架构提供了三个可直接复用的启示:第一,将模型从“全知全能”中解放出来,用索引化技能库替代“上下文灌满”的暴力美学;第二,建立可观测的决策日志,让看门狗这样的“元学习器”从历史中提取模式;第三,拥抱“固化”而非一味依赖提示工程,将高频模式转化为确定性代码,既减少推理开销又提升可靠性。当行业仍在争论“是否需要千亿参数模型”时,这套“35B本地模型+看门狗自我改进”的轻量组合,或许正是Agent走向规模化的务实起点。