大语言模型的推理效率长期受限于自回归(AR)解码的序列依赖性,而扩散模型虽具备并行生成潜力,却在语言建模的从左至右先验上存在短板。NVIDIA 最新发布的 Nemotron-Labs-Diffusion 系列模型打破了这一二元对立——它通过联合训练将 AR 与扩散融合进同一架构,并原生支持自我推测解码(Self-Speculative Decoding),在 3B、8B、14B 三个规模上同时提供基础、指令和视觉语言模型。这不仅是技术路线的微调,更可能开启下一代混合生成范式的商业化落地。
该模型的核心创新在于 三模式统一架构:将自回归损失与扩散损失联合训练,使同一套参数既能从左至右逐 token 生成,又能通过扩散过程并行预测多个 token。这种设计直接利用了两种目标的互补性——扩散增强模型对远期依赖的规划能力,而自回归维持语言生成的局部连贯性。在实际推理中,模型可切换至自我推测模式:扩散分支作为草稿模型快速产出候选序列,自回归分支作为验证器进行精炼。根据论文实验,这一机制的接受率和设备端效率均优于多 token 预测(MTP)方案。在最优化采样器配置下,单次前向传播的产出 token 数相比自我推测模式还可以提升 76.5%。
对行业而言,性能数据更具冲击力:8B 参数的 Nemotron-Labs-Diffusion 在单次前向解码中生成的 token 数达到 Qwen3-8B 的 6 倍;在 NVIDIA GB200 GPU 上搭配 SGLang 推理引擎运行 SPEED-Bench 时,吞吐量提升 4 倍。这意味着在同等硬件条件下,实时对话系统、流式生成任务可以获得更低的延迟和更高的并发。与 DeepSeek 等模型采用的常规推测解码(需额外训练独立草稿模型)不同,NVIDIA 的方案无需为草稿模型单独占用参数量,所有参数在三个模式下共享,训练和部署成本更低。
从趋势看,AR 与扩散的深度融合正在从实验走向工程化。Nemotron 系列同时覆盖了文本生成和视觉语言任务,展现出架构在多模态场景下的可扩展性。对于正在构建实时交互应用的团队,尤其是对话 AI、代码补全、视频流式配音等对低延迟有刚性需求的场景,考虑将推理栈从纯自回归架构迁移至混合架构是值得投入的方向。虽然当前模型尚未在社区广泛验证,但 NVIDIA 的硬件原生优化(GB200、TensorRT-LLM 生态)和 SGLang 的落地案例,为技术迁移提供了明确的路径。下一步值得关注的是,这一架构能否在更大规模(30B+)和更长的上下文长度下保持收益,以及开源社区对推理引擎(如 vLLM、HF TGI)的支持进度。