标题:NVIDIA单挑语言模型范式:AR+扩散合体,吞吐4倍碾压开源
摘要:NVIDIA Nemotron-Labs-Diffusion开创性地将自回归与扩散模型统一在单一架构中,通过三模式训练实现了自我推测解码。8B模型单次前向生成token数达Qwen3-8B的6倍,在GB200 GPU上吞吐量飙升4倍,为实时AI应用提供了全新的架构选择。
跨过文本生成的传统分水岭,AI领域正在经历一次底层架构的范式迁移。一个标志性事件是:来自NVIDIA的最新工作——Nemotron-Labs-Diffusion正式在HuggingFace社区引发热议。这不是一次常规的版本迭代,而是将自回归与扩散模型“置入”同一体系,并证明了二者并非非此即彼,而是可以互为补充、协同进化。
长期以来,语言模型的生成路径被严格划分为两个阵营:开放式生成依赖自回归的“逐词推进”,可控生成则多以扩散模型的“全局迭代”为利器。Nemotron-Labs-Diffusion打破了这个技术壁垒。其核心创新在于采用联合自回归与扩散损失训练,使单一架构具备三重工作模式:纯自回归、纯扩散,以及最具前瞻性的自我推测解码。研究表明,扩散分支擅长“前瞻规划”——它能先描绘整个句子的高维骨架,而自回归分支则提供从左至右、细致入微的语言先验。这种互补性决定了模型能够同时兼顾长距离语义一致性与局部流畅度。
自我推测解码是该模型的战略重心。在此模式下,扩散部分作为高效的“草稿模型”,快速生成一组候选token序列;自回归部分则充当“验证者”,逐token校对。实验证明,这一接受率与解码效率均显著优于业界常用的多token预测方案。更惊人的是,当启用最优化采样器后,单次前向传播所产出的token数量较自我推测模式最高提升76.5%。这意味着,模型可以一张一弛:在简单场景快速扩散生成,在复杂场景自回归深度校验。
整个模型系列涵盖3B、8B、14B三个参数量级,并衍生出基础、指令以及视觉语言模型等变体。横向对比数据极具冲击力:以8B模型为例,其单次前向解码token数是Qwen3-8B的6倍;当配合SGLang推理框架、在GB200 GPU上运行SPEED-Bench测试时,实际吞吐量提升了4倍。这意味着同等算力预算下,原先1000用户的实时对话系统,现在可以轻松服务4000甚至更多用户,且延迟不升反降。
对于业界而言,这一成果释放了重要信号:实时应用团队可以考虑更换架构了。尤其是在智能助手、实时翻译、交互式内容生成等对延迟极度敏感的领域,Nemotron-Labs-Diffusion提供的三模式路径可以大幅降低部署成本。值得注意的是,扩散模型带来的“前瞻规划”能力,在长文生成和多步推理任务中的表现可能更为亮眼,值得开发者在特定场景下做深入压力测试。
长期来看,AR与扩散的混合架构有望成为下一代语言模型的基础配方。它解决了单一自回归模型在长序列生成中难以避免的“局部最优”问题,也弥补了扩散模型在精细表达上的不足。这或许标志着语言模型从“单一定义策略”走向“多头协同推理”的转折点。对于走在技术前沿的AI团队而言,现在就是关注并着手适配这一新范式的合适时机。
摘要:NVIDIA Nemotron-Labs-Diffusion开创性地将自回归与扩散模型统一在单一架构中,通过三模式训练实现了自我推测解码。8B模型单次前向生成token数达Qwen3-8B的6倍,在GB200 GPU上吞吐量飙升4倍,为实时AI应用提供了全新的架构选择。