当图像生成领域早已习惯通过扩散过程“从噪声中重建画面”时,语言模型领域几乎被自回归架构统治了近十年。如今,Google DeepMind 推出 DiffusionGemma,这不仅仅是一个实验性开放模型,更是一种符号性的技术拐点:扩散模型,正式跨界进入语言生成。
简单来说,DiffusionGemma 不走“生成一个 token,再以此预测下一个”的串行路线。它模仿了图像扩散模型中的“前向加噪 – 反向去噪”过程——在文本生成时,先从一段完全随机的噪声开始,再通过不断地去噪和修正,整体并行地还原出完整的文本序列。这种“一步到位”而非“逐次递进”的路径,带来了两个直接优势:速度和迭代纠正能力。
从官方基准来看,DiffusionGemma 在专用 GPU 上的输出速度最高可达传统自回归模型的 4 倍。这不仅意味着延迟上的巨大优化,更深层的意义在于:当语言模型不再受限于 token 顺序,许多原本被“因果掩码”所束缚的长程依赖、全局规划问题,都可能迎来新的解法。
此外,扩散过程的天然特性使其具备“实时自校正”能力。自回归模型一旦在某一步生成内容偏离轨道,后续序列往往不可控,只能靠采样或重复生成来补救;而 DiffusionGemma 通过去噪过程得以多次通盘编辑整段输出,就像画布上的画逐步清晰一样,每次迭代都在修正前一次推理的偏差。这对“大型语言模型幻觉”问题,提供了结构性的对抗手段。
更引人关注的是,DeepMind 选择将其开源发布。这意着整个社区——从边缘设备开发到实时对话系统——都有机会直接调校并探索这套非自回归流水线。对实时翻译、AI 对话、代码生成等对响应速度和内容质量要求极高的场景而言,DiffusionGemma 提供了可即刻使用的技术支点。
当然,必须指出的是,这目前仍是实验性资产。扩散式文本生成是否在所有任务类型上稳定超越自回归模型,尤其是在长文本连贯性和局部词汇精确性上,还需要更多第三方评测的验证。但无论如何,以并行生成替代串行生成,用“全局噪声消退”取代“局部顺序约束”,已经不再是猜想——而是实实在在摆在开发者面前的新范式。
对于关注 NLP 前沿的技术团队:建议不要仅将其看作一个“更快版的语言模型”,更应该理解它如何在生成过程的每一步都植入修正回路,以及这种“可编辑性”如何为新一代 Agent 系统的即时对话纠错和流式推理,打开一扇全新的门。