NVIDIA新模型:保留98.7%质量,生成效率翻2.42倍

在语言模型推理效率战中,NVIDIA给出了一份别出心裁的答卷。Nemotron-Labs-TwoTower的发布,标志着扩散语言模型从学术探索阶段走向工程实用化,为AI文本生成领域的效率瓶颈提供了新解法。

TwoTower的核心创新在于其双塔架构设计。模型由一个冻结的自回归骨干网络(Nemotron-3-Nano-30B-A3B,经25T tokens预训练)和一个可训练的降噪器塔组成。两者通过层对齐交叉注意力机制状态播种策略协同工作:上下文塔保持冻结,负责提供稳定的语义基础;降噪器塔则在约2.1T tokens上专门训练,学习并行解码能力。这种设计让模型在无需重训整个骨干的情况下,直接获得扩散生成能力,极大降低了工程迁移成本。

与传统自回归模型逐token顺序生成不同,TwoTower支持三种解码模式:全扩散模式、模拟AR模式以及原始AR模式。在性能测试中,模型在2×H100上以BF16精度评估,保留98.7%的AR基线质量,但生成吞吐量提升了2.42倍(γ=0.8,块大小S=16)。这意味着,在质量几乎无感知损失的前提下,团队可将生成速度翻倍,对批量文本生成场景(如摘要、翻译、数据扩增)意义重大。

从参数规模看,模型总参数量约60B,但每token活跃参数仅约3B/塔,稀疏激活特性保证了实际部署的计算效率。这种“总容量大、活跃参数少”的设计,正是当前MoE路线之外的另一条高效推理路径。

开源状态是TwoTower的关键加分项。NVIDIA将模型及权重开源并允许商用,这意味技术团队可立即集成到现有流水线中,而非等待云API的限速或成本波动。对于追求低延迟、高吞吐的工程团队而言,这无疑是一个立即可用的加速工具

从行业趋势看,TwoTower代表了语言模型架构创新的一个明确方向:在已有高质量预训练模型上嫁接更高效的解码机制。与其从零训练一个完全并行化的模型,不如利用现成的AR骨干进行增量改造。这种思路将在未来一年内被更多团队采纳,推动文本生成任务向更低的延迟和更优的成本结构演进。