标题:AI智能体成本骤降90%+:路由设计比模型选择更重要
摘要:专业解读Tomer Tunguz关于AI智能体架构的新观点:路由机制决定成本效率,三层分类器-路由器-选择器可使70-80%请求由本地模型处理,Coinbase已验证支出减半。企业应优先优化路由而非追求最强模型。
在AI应用部署热潮中,业界普遍陷入一个误区:拼命追求更强大的基础模型,却忽视了决定成本与效率的核心环节——请求路由。知名VC分析师Tomer Tunguz在其技术博客中指出,构建AI智能体时,路由设计应优先于模型选择。这一观点正在被实践验证:Coinbase在Token使用量持续增长的情况下,通过优化路由、缓存和默认设置,将AI相关支出削减了一半。
传统思路将模型选择视为架构成败的关键,但Tunguz提出了一个更具操作性的三层路由体系:技能分类器(Skill Classifier)、路由器(Router)和模型选择器(Model Selector)。技能分类器负责对用户请求进行预分类,识别任务类型(如代码生成、文本摘要、数据分析等);路由器根据分类结果将请求导向不同的处理管道;模型选择器则从候选模型库中挑选最合适的执行单元。这种分层设计使得廉价计算资源被最大程度利用——分析显示,经过良好路由优化的系统中,70%到80%的流量可由本地小模型或异步推理完成,而无需调用昂贵的云端大模型。
成本差异悬殊得惊人。本地计算几乎为零边际成本,异步批量推理比实时推理便宜两个数量级。而现实中,绝大多数工作根本不需要秒级响应。大多数文档处理、数据清洗、内容审核等任务,延迟容忍度可达数分钟甚至更久。Tunguz强调,对于那些可以延迟处理的任务,采用夜间批量评估器异步更新路由权重,白天由同步预测器标记复杂任务并决定是否升级模型,这种“夜间学习-白天执行”的模式可进一步降低实时计算开销。
技能蒸馏(Skill Distillation)为路由优化提供了重要支撑。通过将大模型的能力蒸馏到特定领域的小模型中,非编码类任务(如邮件撰写、文档摘要、客服问答)中,70%到80%的智能体流量可由本地模型平滑处理。这意味着企业无需为每个请求支付大模型API费用,而是将有限的高成本算力集中在真正需要深度推理的复杂请求上。
从行业趋势看,这一观点与微软、谷歌等厂商的实践方向一致。微软Copilot栈中默认启用的智能缓存和请求路由,本质上就是类似的三层架构。而谷歌Gemini API的缓存定价策略,也在引导开发者优先考虑缓存命中率。Tunguz的建议对做AI应用的团队具有直接参考价值:投资路由架构设计,远比纠结于选哪个模型更具性价比。具体而言,建议从三方面着手:第一,建立任务类型分类模型(可基于轻量级BERT或蒸馏后的TinyLLM);第二,设计基于成本和延迟的多目标路由策略;第三,构建持续优化的闭环——利用运行数据定期更新路由规则。
长远来看,随着开源小模型性能逼近GPT-4级别,路由优化将成为降低AI部署成本最核心的竞争力。那些率先建立精细路由体系的团队,将在成本优势上甩开竞争对手,同时保留对大模型按需调用的灵活性。模型能力再强,也敌不过一条聪明的路由。