自回归语言模型在生成长文本时面临显著的推理瓶颈——逐 token 解码无法并行,GPU 利用率随批大小增大而摊薄。扩散语言模型(Diffusion LM)虽然允许部分并行解码,但往往需要从零训练完整架构,难以复用已有大规模预训练模型的分布。NVIDIA 在开源 Nemotron-3-Nano-30B-A3B 的基础上,提出 Nemotron-Labs-TwoTower 双塔扩散语言模型,将扩散解码能力“嫁接”到冻结的自回归骨干上,几乎无损基座质量,却让吞吐量翻倍。
核心设计是双塔架构。上下文塔(Context Tower)完全冻结,使用 Nemotron-3-Nano-30B-A3B(MoE 架构,总参 30B,每 token 活跃约 3B,在 25T token 上预训练)。降噪器塔(Denoiser Tower)从头训练,参数规模同样约 30B(每 token 活跃约 3B),接收带噪声的隐表示,通过 层对齐交叉注意力(Layer-Aligned Cross-Attention)与上下文塔每一层的输出来对齐,再以 状态播种(State Seeding)机制将降噪结果注入骨干的推理路径。两个塔在层级别深度耦合,但梯度只流经降噪器塔,上下文塔保持权重不动。
训练降噪器塔时,NVIDIA 使用约 2.1T token 的数据,在文本空间执行连续时间扩散。推理时支持三种解码模式:扩散模式(标准迭代去噪)、模拟 AR 模式(用当前降噪步近似自回归条件分布)、纯 AR 模式(直接使用冻结骨干的原始自回归解码,无需降噪器)。这种设计让模型能灵活适配不同延迟和吞吐需求:当批量较大时,扩散模式以 16 block 为单位并行生成,吞吐提升 2.42 倍(γ=0.8,块大小 S=16)的同时,保留自回归基线的 98.7% 生成质量,在 2×H100 上以 BF16 评估。
相比此前仅改变预测目标或引入并行解码头的方法,TwoTower 的思路更具工程实用性:它没有破坏已有的自回归预训练分布,而是将其作为“锚点”,让降噪器塔学习在锚点周围快速收敛。这对企业级应用意义重大——团队可以直接复用自己微调过的自回归模型作为上下文塔,仅训练一个降噪器塔,即可获得 2-3 倍的推理加速,而质量损耗控制在 1-2% 以内。模型总参数约 60B,但每 token 活跃参数约 6B(上下文塔 3B + 降噪器 3B),与一般的 7B 密集模型推理开销相近。
NVIDIA 已公开开放权重并允许商用。对于需要大规模并行生成(如摘要、文案、对话回复批量生成)的团队,这是一个即插即用的加速工具:若已有基于 Nemotron 系列的微调模型,直接将其作为上下文塔接入 TwoTower 训练框架即可;若从零开始,可直接使用开源的 Nemotron-3-Nano-30B-A3B 及配套降噪器权重。此外,三种解码模式切换无需重新加载模型,适合在线服务根据当前负载动态调整推理策略。预计这种“冻结骨干+可训练扩散塔”的范式将影响后续高效生成模型的开发方向——与其从头设计非自回归架构,不如为现有最强自回归模型加装扩散解码器。