NVIDIA双塔扩散模型惊现:百亿级大模型推理吞吐飙升2.4倍

在大模型推理成本居高不下的行业痛点下,NVIDIA近日发布的Nemotron-Labs-TwoTower扩散语言模型,为高性能文本生成找到了一个高效、实用且开源的解决方案。该模型并非从零训练,而是巧妙地在已经打磨成熟的Nemotron-3-Nano-30B-A3B自回归骨干网络上”嫁接”了一个扩散降噪网络,实现了近乎无损的加速提升。

与传统的自回归模型按token逐个生成不同,Nemotron-Labs-TwoTower采用创新的双塔架构。其中,上下文塔被完整冻结,保留了原有预训练模型在25万亿token上积累的卓越语言能力。而新增的降噪器塔则在约2.1万亿token的海量数据上进行了专门训练。两个模块通过精心设计的层对齐交叉注意力和状态播种机制实现协作,使扩散解码过程能够精准地利用和补全自回归模型的语义信息。这样的设计本质上是将扩散模型的无序生成效率与自回归模型的深度语义理解能力进行了有机结合。

从实测数据来看,这一架构确实带来了量变到质变的飞跃。在2张H100 GPU、BF16精度下,该模型保留了自回归基线98.7%的生成质量,这是一个令人惊讶的数字。相比之下,其生成吞吐量却提升了2.42倍(在压缩率γ=0.8,块大小S=16的条件下)。这种效率提升意味着对于大批量文本生成场景,如实时对话、搜索摘要、产品描述等,可直接将算力成本腰斩,或者同等算力下实现接近翻倍的处理能力。

值得一提的是,该模型支持三种解码模式:扩散模式实现最佳吞吐量;模拟AR模式在加速与质量间取得平衡;AR模式则完全恢复传统的自回归生成路径以满足特定任务需求。这种设计赋予了团队极高的灵活性。模型整体参数量约60B,但每次仅激活约3B参数/塔,保持了低计算开销,这对实际部署极为友好。

从行业趋势来看,NVIDIA的这一动作揭示了一个重要信号:大模型推理加速正从纯工程层面的量化、剪枝,转向架构创新与模型协同。对于有批量生成需求的团队而言,这无疑是一款可以即刻引入生产线的成熟工具。建议读者重点关注其开源许可协议,并立刻在自有数据集上评估其性价比——这可能是短期内实现生成效率翻倍的最佳路径。