扩散语言模型(Diffusion LM)在文本生成领域展现出独特优势——支持并行解码和高可控编辑,但过去这类模型需要从零开始训练,成本高昂且难以复用已有的高性能自回归(AR)模型。NVIDIA最新开源的Nemotron-Labs-TwoTower打破了这一限制:它巧妙地将扩散解码器“嫁接”在冻结的AR骨干上,在几乎不损失质量的前提下将生成吞吐量提升至原来的2.42倍,并且开放了可商用的权重。这一成果不仅是一次架构创新,更指向了AI推理工程化的务实路径。
该模型的核心设计是双塔架构:上下文塔(Context Tower)直接复用预训练的Nemotron-3-Nano-30B-A3B(30B总参、3B活跃参数,约25T tokens预训练),并完全冻结;降噪器塔(Denoiser Tower)则是新训练的扩散解码器,总参约30B、每步活跃参数同样约3B,在约2.1T tokens上训练。两塔通过层对齐交叉注意力和状态播种机制协同工作——上下文塔提供稳定的语义理解,降噪器塔负责渐进去噪生成。这种设计使得扩散解码能够直接利用已有AR模型的能力,避免了重复训练骨干的巨额开销。
在2×H100上使用BF16评估,结果令人印象深刻:保留98.7%的AR基线质量(以标准指标衡量),而生成吞吐量提升2.42倍(采用γ=0.8、块大小S=16的设置)。模型支持三种解码模式:扩散模式(并行生成,速度最优)、模拟AR模式(逐token但用扩散逻辑)以及标准AR模式(完全回退到原始骨干)。这为开发者提供了灵活的速度-质量权衡选项。
从行业背景看,语言模型的推理效率已成为部署瓶颈。传统AR模型受限于逐token自回归,延迟随序列长度线性增长;而纯扩散LM(如Diffusion-LM、SSD-LM)虽然并行度高,但生成质量长期落后于AR。NVIDIA的TwoTower策略提供了一种“最佳中间态”:用AR骨干保证语义连贯性,用扩散解码释放并行潜力。相比近期其他混合方案(如Medusa、Speculative Decoding),TwoTower完全改变了生成过程的底层逻辑,而非仅做近似加速。
特别值得注意的是,该模型开源且可商用,意味着团队可以即时下载权重并集成到自己的推理管线中。对于内容批量生成(如产品描述、摘要生成、对话回复)的场景,二倍以上的吞吐提升可直接降低GPU时租成本,或让单卡服务更多请求。不过,由于降噪器与骨干是紧耦合设计,开发者若需更换骨干则需重新训练降噪器——因此建议直接基于Nemotron系列模型构建应用。
趋势判断上,这种“基础骨干+可插拔解码器”的设计范式很可能在未来成为主流。随着各厂商竞相推出数十B至数百B的预训练模型(如LLaMA、Qwen、Mistral),通过嫁接扩散解码器来提升推理效率,将比重新训练一个同等质量的全扩散模型经济得多。NVIDIA此次开源不仅验证了路线可行性,也为社区提供了可直接上手的工具。下一个挑战或许是:如何在保证2×+吞吐提升的同时,进一步缩小质量差距(从98.7%向99.9%靠拢),并将支持序列长度扩展到长文本。