大型语言模型的推理效率瓶颈正从“参数规模”转向“生成范式”。Transformer自回归(AR)解码虽能生成高质量文本,却受限于逐token串行计算,难以满足低延迟需求。扩散语言模型(Diffusion LM)通过迭代去噪实现非自回归生成,但在长程依赖和语言先验上表现欠佳。NVIDIA最新研究Nemotron-Labs-Diffusion打破了这一对立:它将AR与扩散训练整合进同一模型,并额外引入第三种“自我推测解码”模式,在单一架构下统一三种生成范式。
该研究的核心洞察在于两种目标函数的互补性:扩散训练赋予模型前瞻规划能力,使其能同时考虑未来token的分布;而AR训练则保留从左至右的语言先验,确保序列连贯性。在自我推测模式下,扩散分支充当低成本草稿模型,AR分支作为验证者——这与Google的推测解码思路相似,但不同之处在于草稿和验证共享权重,无需额外训练。实验显示,该模式的接受率和实际设备效率均优于多token预测(MTP)。进一步地,若采用最优化的采样器(推测与验证合并为单次前向),模型单次前向传播产生的token数比自我推测最多高出76.5%。
Nemotron系列包含3B、8B、14B三种规模的基础、指令和视觉语言模型。以8B版本为例,它在单次前向解码中产生的token数量是Qwen3-8B的6倍;在GB200 GPU上通过SGLang推理框架运行SPEED-Bench基准时,端到端吞吐量提升4倍。这意味在相同硬件条件下,实时对话、语音交互、在线翻译等场景的延迟可降低75%以上。值得注意的是,该模型在准确率上同样超越现有开源AR与扩散LM——例如在MMLU、HellaSwag等标准评测中,8B模型以更少的计算量达到或接近Llama-3-8B的水平。
从行业背景看,这一进展直击当前LLM部署的两大痛点:一是AR模型自回归解码的串行瓶颈,二是扩散模型预训练与推理流程割裂导致的工程复杂度。Nemotron-Labs-Diffusion通过统一框架同时优化了训练效率与推理速度,并且其“三模式”设计允许开发者根据任务灵活切换(高保真用AR,低延迟用扩散或自我推测),具有极高的工程可操作性。NVIDIA选择在SGLang这一主流推理引擎上验证性能,也暗示了其快速落地的意图。
对技术团队而言,如果正在开发实时性敏感的AI应用(如智能助理、实时字幕生成、游戏NPC对话),Nemotron-Labs-Diffusion提供的4倍吞吐量提升值得认真评估。虽然目前该模型仍处于论文与开源阶段,但其架构思路——将生成范式从“互斥”走向“融合”——可能成为未来LLM推理优化的关键方向。建议相关团队关注其后续在vLLM、TensorRT-LLM等框架上的适配进展,并提前在GB200或等效硬件上建立测试基准。