大模型行业正陷入令人尴尬的“算力通胀”——模型参数量以指数增长,而实际有效利用率却被长上下文、工具调用等场景迅速稀释。在AICon演讲中,蚂蚁集团副总裁周俊以一组数据戳破泡沫:万亿参数模型单次运行15分钟的算力成本,约等于一辆特斯拉。当智能体(Agent)开始成为核心载体,效率已不再是“可选项”,而是决定技术能否落地的“必答题”。
周俊团队给出的解题思路并非简单堆砌硬件或模型压缩,而是从底层逻辑切入:将过去追逐“更多Token数量”的理念,转向追求“更高Token密度”。核心突破在于一套名为“7+1”的混合线性注意力架构——7份Lightning Attention搭配1份MLA(混合线性注意力)。这一架构将256K长上下文的计算成本从指数级增长拉平至线性级,释放出的算力不再浪费在冗余的注意力计算上,而是真正用于推理与思考。对比行业内广泛采用的稠密自注意力,这一设计相当于把带宽从“全量通车”变为“动态车道分流”,本质是在信息密度和计算开销之间找到了新的平衡点。
如果说架构优化是“硬件”层面的重构,那么算法侧的创新则更直击痛点。周俊团队提出的Kpop算法,首次系统性地区分了工具调用Token与自然语言Token——前者是智能体与外部环境交互的关键指令,后者是常规语义表达。通过思维链剪枝与自蒸馏技术,模型在不损失能力的前提下,Token输出量减少了约4倍。这意味着Agent与模型的交互轮次中,原本动辄数千Token的冗长推理过程被压缩,仅保留高效决策相关的内容。实测数据印证了效果:在LongBench、BFCL等基准测试中,千亿级参数(100B左右)模型在Agent任务上的表现超越部分万亿级模型;小型模型的flash吞吐更达到2.4倍,五轮对话成本下降10倍以上。
这一系列实践的本质,是将大模型的效率问题从“局部优化”推向“架构-训练-智能体协同设计”的范式层面。当行业仍在比拼参数规模时,蚂蚁的案例表明:对于Agent场景,Token密度比参数量更能决定实际可用性。未来的竞争力将取决于如何在同等算力预算下,让模型“思考更多、表达更少”。对模型团队的建议是:尽早将长上下文成本结构从指数转变为线性,通过Token级调控压缩冗余输出,并让训练和推理阶段共享同一套效率目标——这是万亿参数“降本”的唯一出路。