大型语言模型的生成效率一直是工业级部署的关键瓶颈。自回归(AR)解码虽质量稳定,但顺序生成导致吞吐受限;纯扩散模型虽可并行采样,但质量往往难与同等规模的AR模型匹敌。NVIDIA最新开源的Nemotron-Labs-TwoTower打破了这一权衡,首次将扩散解码以一种近乎无损的方式嫁接在已有的自回归骨干上,实现了吞吐量翻倍而质量只下降1.3%的工程奇迹。
TwoTower的核心创新在于其双塔架构。它基于一个已经在25T token上预训练的AR骨架(Nemotron-3-Nano-30B-A3B),将其作为上下文塔(Context Tower)冻结,同时训练一个全新的降噪器塔(Denoiser Tower),通过层对齐交叉注意力(Layer-Aligned Cross-Attention)和状态播种(State Seeding)机制与前者协作。上下文塔负责保持语义理解和自回归的质量,而降噪器塔则通过扩散过程以步长方式生成token,显著减少解码步数。
在2×H100上的BF16评估显示,当采用γ=0.8、块大小S=16的扩散解码时,模型保留了AR基线98.7%的准确度,但生成吞吐提升了2.42倍。降噪器塔仅在约2.1T token上从头训练,而骨干权重完全不变,这意味着任意预训练AR模型理论上都可以通过这种“外挂”方式获得加速,而不需要重新训练整个大模型。
从参数效率来看,TwoTower总参数量约60B,但由于每token在每座塔上只激活约3B参数(通过A3B结构实现稀疏专家激活),实际计算开销远低于同等参数量的稠密模型。模型支持三种解码模式:纯扩散(高效并行)、模拟AR(保留顺序可控性)以及原生AR(完全兼容基线),用户可根据任务在延迟、质量和吞吐之间灵活切换。
这种设计的工程价值在于:它没有推翻已有的高质量AR模型,而是在其上添加一个可训练的“加速器”,且开源可商用。相比推测解码(Speculative Decoding)依赖小模型近似,或Medusa等并行头部方法需修改模型结构,TwoTower的独立降噪器塔使得集成更加直接——它不改变AR骨干的任何权重,对已有的调优管线几乎零侵入。对于需要高吞吐的批量文本生成场景(如智能客服、内容摘要、多语言翻译),这意味着一台GPU能承载更多并发请求,或者相同请求下响应延迟更低。
从行业趋势看,NVIDIA此举将加速“扩散+自回归”混合架构的普及。降噪器塔的引入挑战了一个固有认知:自回归模型的核心质量必须由自回归解码来保证。TwoTower用实证表明,扩散解码可以在几乎不损失信息的前提下大幅减少解码步骤,且冻结骨干意味着可以利用社区已有的海量预训练权重。未来,我们很可能看到更多厂商采用类似思路——在成熟AR模型上“挂载”扩散解码器,既保留原有微调生态,又获得可观的吞吐收益。对于开发者,现在已可下载模型进行实验,重点关注降噪器塔的token消耗与推理内存开销,以评估自身场景下的加速比。