多编码器匹配90小时蒸馏FLUX.2,一步生成性能反超原版四步模型

扩散模型虽以多步迭代采样主导图像生成,但长期以来,一步生成器在质量上难以匹敌。近期一篇来自社区热榜的论文重新发现了表示分布匹配(RDM)的潜力,通过将经典最大均值差异(MMD)从“玩具目标”改造为可扩展的一步训练准则,并在多编码器匹配框架下防止视觉“作弊”,最终以极低成本将FLUX.2的四步模型压缩为一步,且性能不降反升。这一思路可能改写当前蒸馏技术的效率标准。

研究团队首先揭示了一个反直觉的事实:MMD作为分布匹配损失,在正确估计后成为训练一步生成器的优秀目标。传统观点认为MMD对高维特征不敏感且难以规模化,但作者证明,使用基于高斯核的MMD并配合足够大的mini-batch(最优超过2048样本),MMD能有效约束生成分布与参考分布之间的高阶矩对齐。这一发现在ImageNet 256×256上得到验证:经典的MMD目标让一步生成模型在FID指标上逼近甚至超越同期蒸馏方法。

更关键的改进在于破解了“单一表示可被欺骗”的问题。此前基于特征匹配的方法(如教师-学生特征回归)常选择单一预训练编码器(如DINO或CLIP),但网络极易“过拟合”该表示,在视觉上生成虚假细节。iRDM采用平衡编码器组合——融合DINOv2、CLIP、MAE等多种冻结编码器的特征,并引入独立于训练损失的SW_r14(Sliced Wasserstein距离在ResNet14特征上的评估)作为无偏质量度量。实验表明,多编码器匹配不仅消除了作弊空间,还显著提升了感知质量与多样性。

在核心结果上,改进后的iRDM在ImageNet 256×256上以SW_r14 1.30达到一步生成当前最优,并在PickScore人为偏好评估中71.2%的样本偏好iRDM。更令人印象深刻的是对FLUX.2的迁移实验:仅需90小时的NVIDIA H200 GPU训练,iRDM将FLUX.2的4步过程压缩为单步,在GenEval基准上得分0.826(原版0.794),PickScore提升至22.76(原版22.58)。这意味着一步生成不仅在效率上胜出,在语义一致性和美学评分上也开始反超多步扩散

从行业视角看,这篇论文传递了几层信号:第一,经典统计方法(如MMD)在深度学习时代可能被低估,正确的估计和组合策略能释放其潜力;第二,低成本后训练(90小时)让一步生成模型落地门槛大幅降低,小团队也能复现;第三,在视觉生成领域,单纯追求更大模型或更多蒸馏步骤未必最优,分布匹配与多编码器协同的思路值得借鉴。对于从事图像生成的研究者与工程师,建议重点关注iRDM中关于batch size与编码器选择的具体实践,这些细节直接决定训练的稳定性与最终质量。