标题:路由优先于模型:AI智能体成本削减90%的工程密码
摘要:传统AI架构过度关注模型选择,而Tomer Tunguz指出智能体设计的核心在于路由。通过三层分类器-路由器-模型选择器架构,可让70-80%流量运行于低成本模型,将推理开支降低90%以上。Coinbase实践已证实其有效性。
在AI应用从“演示”走向“生产”的今天,绝大多数团队仍然陷在“选哪个模型最好”的思维定式中。风险投资人Tomer Tunguz在其博客中提出了一个颠覆性的设计原则:路由(router)是第一性原理,模型只是工具。这一观点直击当前AI工程化中最大的隐性浪费——用昂贵的大模型处理本该由轻量模型甚至本地计算完成的任务。
Tunguz的观点并非空谈。Coinbase首席执行官Brian Armstrong披露的数据提供了有力佐证:在token使用量持续增长的同时,该公司通过优化默认设置、路由逻辑和缓存,将AI支出削减了一半。这一结果暗示,成本优化的瓶颈不在模型本身的定价,而在请求分发的智能程度。
文章将路由架构解构为三个层面:技能分类器(Skill Classifier)、路由器(Router)、模型选择器(Model Selector)。技能分类器判断请求属于哪类任务(如代码生成、内容总结、客服问答);路由器基于任务类型和延迟容忍度决定处理层级——本地模型、异步批量推理还是实时大模型;模型选择器则在同层级内做最终微调。这种分层设计使得70-80%的智能体流量可在本地模型或异步推理上运行,而本地计算成本趋近于零,异步批量推理比实时推理便宜两个数量级。
值得注意的是,多数工作负载并不需要秒级响应。Tunguz建议通过同步预测器标记复杂任务,同时利用夜间批量评估器自动更新路由权重,实现路由策略的动态优化。这种“先判断,再执行”的思维,本质上是对算力资源的精细化调度——类似计算机网络中的流量工程,但在AI推理领域仍属稀缺实践。
当前行业普遍将注意力集中在模型性能排行榜上,却忽视了推理链路上的效率黑洞。Tunguz提出的“技能蒸馏”(Skill Distillation)进一步指出:在非编码类任务中,经过蒸馏的模型可承接70-80%的智能体流量。这意味着大多数团队完全可以用一个数亿美元的模型做“消防队”,而用免费或低价模型完成日常工作的绝大部分。
对于AI应用开发者,核心启示非常明确:优先设计路由逻辑,而非模型选择。建议从三个步骤切入:一、梳理业务中所有请求的延迟容忍度分布,将容忍秒级返回的请求全部引导至异步推理通道;二、构建Task→Capability映射表,识别出适合本地模型的技能集;三、建立路由权重的半自动更新机制,利用线上数据持续优化分配策略。当路由成为架构的第一性原理,90%的成本缩减并非不可实现的技术承诺。