万亿模型15分钟烧掉一辆特斯拉?蚂蚁周俊提出“Token密度”新解法

大模型的参数竞赛正加速走向效率瓶颈。蚂蚁集团副总裁周俊在AICon上披露的算力账单一针见血:一个万亿参数模型,每运行15分钟,其GPU算力成本约等于一辆特斯拉Model 3的售价。当行业仍在追逐“更多Token、更大参数”时,他提出一个转向——从“Token数量”转向“Token密度”——这意味着,真正决定模型价值的不是它吞吐了多少文本,而是它能在同等算力下输出多少有效信息。

蚂蚁百灵团队的解题思路落在架构、训练与智能体协同设计的交叉点上。他们设计了一种7+1混合线性注意力架构:7份Lightning Attention加1份MLA(混合线性注意力)。这一架构的核心是将长上下文(256K token)的计算复杂度从指数级降至线性级,释放出的算力不再用于冗余计算,而是更集中地投入到“思考”环节。在同等算力下,模型有更多空间进行深度推理,而非被长序列的显存占用拖垮。

更值得关注的改进在Token级别。团队提出了Kpop算法,这是一种区分工具调用Token与自然语言Token的精细控制机制。痛点在于:当前模型在Agent任务中,工具调用(如API参数、SQL语句)与自然语言混合出现,但传统模型对所有Token一视同仁,导致大量算力浪费在无需高精度推理的语句上。Kpop算法识别并分开销路,配合思维链剪枝与自蒸馏技术,最终实现Token输出减少约4倍,而模型在LongBench、BFCL等基准上的表现不降反升。

这些优化在智能体任务中展现出明显的效率优势。周俊分享的数据显示,蚂蚁的千亿参数模型在Agent任务中已超越部分更大参数模型,而小模型(百亿级别)的flash吞吐达到2.4倍,五轮对话成本下降超过10倍。这意味着,在智能体频繁调用工具、多轮交互的典型场景中,模型不再是“算力吞金兽”,而可能成为可规模落地的业务引擎。

从行业视角看,周俊此次演讲的意义在于将效率从零散优化提升到了架构与系统协同的范式层面。过去,GPU换卡、量化剪枝等战术手段已逼近边际收益递减,而7+1注意力混合与Token密度思路则指向硬件-算法-任务的三层共振。对于模型开发者而言,未来的竞争不会停留在参数量或训练数据规模上,而是看谁能用更少的Token完成更复杂任务的推理——即单位Token的信息密度。对创业者来说,这意味着部署成本不再是障碍,小团队通过调优“Token密度”同样有机会在Agent赛道构建差异化优势。效率优先,正是智能体时代通往规模化的关键路径。