一步生成是图像生成领域“效率与质量平衡”的终极目标。传统扩散模型依赖数十步迭代采样,虽能产出高保真图像,但推理延迟严重限制了其在实时场景(如交互式设计、移动端生成)中的应用。蒸馏、对抗训练等方法试图压缩步数,却常面临质量下降或训练不稳定问题。HuggingFace Daily Papers最新热门工作“表示分布匹配(RDM)及其改进版iRDM”给出了一条新路径:以经典的最大均值差异(MMD)为核心,重新设计训练目标,使单步生成器在质量上反超多步模型。
RDM的核心思路是让生成的图像特征分布与预训练编码器下的参考分布相匹配。研究者发现了三个关键洞见:第一,长期以来被认为难以扩展的MMD,在正确估计(如采用高斯核且合理选择带宽)后,成为一个高度可扩展的一步生成目标,训练稳定性远超GAN式对抗损失;第二,生成批次大小对性能影响显著,最优值超过2048——这与直觉相反,小批次反而导致梯度噪声过大,而大批次能提供更准确的分布差异信号;第三,如果只匹配单一编码器(如单纯匹配CLIP视觉特征),模型会学会“欺骗”该表示,产生视觉上不自然但统计上接近的伪像。因此必须匹配一组平衡的编码器(如DINOv2+CLIP+LPIPS),并用与训练损失无关的指标(SW_r14)独立评估,才能获得真正的视觉质量提升。
改进后的iRDM在ImageNet 256×256上以SW_r14 1.30的成绩达到一步生成SOTA,且人类偏好测试显示71.2%的样本更倾向iRDM而非此前最佳方法。更令人瞩目的是,研究者将FLUX.2这一四步扩散模型后训练为一步生成器:仅需90个H200 GPU小时,在GenEval上以0.826对0.794、PickScore上以22.76对22.58的双指标超过原版四步模型。这意味着无需改动预训练模型架构,仅通过分布匹配的微调,就能将推理效率提升4倍的同时改善质量,这在工业部署中具有极高价值。
对于视觉生成领域从业者,这篇论文给出了几个实用启示:第一,如果你手头有一个多步扩散模型,不妨尝试用分布匹配将其压缩为一步,成本极低(旗舰卡运行不到4天);第二,不要依赖单一特征度量,多编码器组合与独立的评估指标才是防止过拟合的保障;第三,MMD的复兴提示我们,经典统计方法在深度学习时代可能被低估,找对应用场景和训练技巧就能焕发新生。未来,分布匹配有可能替代蒸馏成为高效生成的标准范式,尤其是在对延迟敏感但资源受限的场景中。值得持续关注iRDM在更大尺度模型(如Stable Diffusion 3、Sora类视频模型)上的扩展效果。