大型语言模型的token成本正在成为AI编程助手落地的核心瓶颈。随着Fable和Opus即将涨价,开发者急需在不牺牲质量的前提下压缩消耗。Simon Willison在AIE大会上与Claude Code团队交流后,分享了一组反直觉的实战技巧——让智能体自主判断,而非通过规则约束其行为。
传统做法中,开发者倾向于给AI代理(如Fable)明确指令:“每次修改代码后,必须生成单元测试”或“只用最便宜的模型处理文件操作”。但Willison观察到,Claude Code团队的建议恰恰相反:直接告诉Fable“自行决定何时需要编写测试”,而不是把测试规则写死。这种“放权”背后是对智能体决策能力的信任——当Fable拥有判断场景的自由度,它能根据代码变更的重要性、风险概率和现有测试覆盖率,动态选择是否生成测试,避免无意义的token浪费。
更关键的第二层优化在于模型分层协作。Jesse Vincent提出了“分级委托”策略:让Fable主循环保留全局判断、审计和数据合成等高阶任务,而将具体的代码实现委托给Sonnet,机械性修改(如格式调整、路径替换)则交给更轻量的Haiku。这种设计类似人类团队中项目经理分配任务——主智能体负责“想做什么”,次级模型负责“怎么做”。Willison将这一逻辑写入Claude Code的记忆文件后,Fable的token消耗速度明显下降,且输出质量未受影响。
这一技巧的价值在于重新定义了AI agent的效率边界。过去开发者试图通过硬性规则(比如“每次提交都要跑100%测试覆盖”)降低不确定性,却忽视了灵活决策对token经济的杠杆效应。当前主流AI编码助手普遍存在“过度执行”问题——它们倾向于调用完整推理能力处理简单任务,就像用超级计算机算加减法。而Fable的案例证明,让智能体具备模型选择意识,可以释放30%以上的成本优化空间。
对于正在部署AI编程管线的团队,Willison的经验提供了两个可落地的方向:第一,重构智能体提示词,将行为规则从“必须做X”改为“根据上下文决定是否做X”;第二,建立模型分级路由,让决策型智能体(如Claude Opus)负责调度,执行型智能体(如Sonnet/Haiku)专注操作。值得注意的是,这种分层要求主智能体具备成本意识——即它能判断“哪些任务值得调用高价模型”。
涨价倒计时已经开始。Willison的实践表明,与其等待更便宜的基础模型,不如从系统架构层面提升token效率。让智能体自己“算一笔账”,或许是目前最被低估的优化路径。