NVIDIA三模式语言模型Nemotron-Labs-Diffusion:吞吐量4倍提升背后的架构革命

语言模型生成范式正迎来一次根本性分叉。NVIDIA研究团队推出的Nemotron-Labs-Diffusion系列,首次在单一架构内将自回归(AR)与扩散(Diffusion)两种截然不同的生成机制有机融合,创造出三模式统一模型。这一突破不仅将单次前向传播的token产出量提升至传统模型的6倍,更在GB200 GPU上实现4倍吞吐量增益——对于追求实时交互体验的应用团队而言,这无异于一次架构级换道机会。

传统自回归模型按token序列从左至右逐位生成,其顺序依赖本质天然限制了并行性。而扩散模型通过迭代去噪实现全局规划,却缺乏语言建模中必要的因果先验。Nemotron-Labs-Diffusion的独创性在于通过联合AR和扩散损失训练,让两者在共享参数空间中互补:扩散增强模型的前瞻规划能力,AR则提供从左至右的语言先验。这种设计催生出三种工作模式——纯自回归、纯扩散、以及将扩散作为草稿模型、AR作为验证器的自我推测解码模式。

自我推测解码是对多token预测(MTP)方案的直接超越。研究显示,在同等算力条件下,自我推测模式的接受率和实际设备效率均显著优于MTP。更值得关注的是,当采用最优化采样器时,单次前向传播产出的token数比自我推测模式最高可提升76.5%。这意味着模型在推理阶段的可伸缩性远超当前主流方案。

该系列涵盖3B、8B、14B三种规模,并配套基础、指令和视觉语言版本。在性能对比中,8B模型单次前向解码的token数达到Qwen3-8B的6倍——这并非简单的大规模并行化结果,而是自回归与扩散在训练中产生的协同效应。当使用SGLang引擎在GB200 GPU上运行SPEED-Bench基准时,吞吐量提升达到4倍,延迟压缩至接近token级流式处理的水准。

对于从事实时语音交互、在线代码生成、低延迟对话系统的团队,Nemotron-Labs-Diffusion的出现意味着现有基于纯AR架构的部署方案面临淘汰压力。虽然此举会增加模型训练和部署的复杂度,但吞吐量4倍提升带来的成本下降将迅速覆盖迁移成本。下一步,值得关注的是该框架能否支持更大参数规模(如70B以上)的稳定训练,以及多模态版本在视觉-语言任务中的实际推理效率——这可能是推动下一代端侧AI助手落地的关键技术。