千问Agent“多快好省”哲学:Token消耗骤降至海外1/10,主动服务成新战场

2026年1月,千问App上线“胶囊”入口的通用复杂任务Agent,这一动作不只在产品端引发关注,更在工程界掀起波澜。千问团队总结出的“多快好省”方法论,正为AI Agent行业提供一份务实且极具竞争力的顶层设计范本——用一句话概括:在多模态任务下,既要跑得快,又要花得少,还得交得出活。

“快”与“省”之外的工程博弈。“多快好省”四个字看似朴素,实则在Agent工程领域构成一个三角悖论:一般产品用户增长快,但执行质量必须稳;任务复杂,算力消耗就高。千问团队给出的平衡点在于:执行时间已压缩至最初版本的1/3,而Token消耗仅相当于海外同类产品的十分之一。在算力资源紧张的当下,这种“低功耗、够用就行”的工程导向,直接对冲了行业普遍存在的“大模型必求大算力”的攀比风。千问用搜索范式与上下文管理的组合拳,在不牺牲任务准确率的前提下,将成本压至地板级——这背后是不同于Prompt Engineering的“Harness Engineering”思路。

从被动响应到主动服务:Agent的“情商”难题。多快好省解决的只是当下,千问团队已经在思考Agent的下一形态——主动服务。在实现层面,团队构建了四大组件:User Memory(用户记忆)、Environment(环境感知)、Task System(任务系统)与Assistant(助手行为引擎)。朱达坦言,其中最难啃的骨头并非技术本身,而是“情商”——理解用户的潜在意图,并在正确时机主动触发服务,而非静待指令。这要求Agent具备“换位思考”能力,深挖用户情绪、语境与长期行为模式,而这正是当前几乎所有C端Agent的软肋。

AIWare Engineering:下一站是“低功耗赢家”。朱达将Agent工程演进分为三个阶段:Prompt Engineering(提示工程)-> Harness Engineering(套件工程)-> AIWare Engineering(AI固件工程)。这不仅是研发范式的更新,更是一场硬件与软件的协同革命。AIWare Engineering理念倡导的“低功耗,够用就行”,正对应Agent产品在端侧部署、边缘计算时的现实诉求——厂商不再盲目堆算力,而是追求在有限功耗下实现最佳任务完成度。或许,未来Agent产品的核心竞争力,将不再是参数规模,而是“单位功耗下的任务完成密度”。

千问团队的实践至少给行业提供了两个可参照的坐标:在成本竞争上,Token层面的极度压榨能为更多中小团队带来入场机会;在功能设计上,主动服务的“情商”打磨,则是从“工具”走向“伙伴”的关键一跃。对于正冲刺复杂任务Agent的团队而言,眼下需要思考的不只是如何跑得更快,更是如何在算力有限的前提下,跑得更聪明、更体贴。