NVIDIA PixelDiT入选CVPR2026最佳论文候选:端到端像素扩散终结自编码器时代

CVPR最佳论文候选的含金量无需赘言——在计算机视觉领域,能进入这一名单的方法,往往意味着对主流技术路径的颠覆性修正。NVIDIA Research提交的PixelDiT正是如此:它直接绕过了过去几年扩散模型赖以生存的“压缩-解压缩”范式,将生成过程完全置于像素空间内完成。

传统扩散模型(如Stable Diffusion、DALL·E)普遍依赖变分自编码器(VAE)或类似的自编码器结构,先将图像压缩到潜在空间,再在低维特征上进行扩散与去噪。这一设计的初衷是降低计算复杂度——像素空间的高维性让大模型难以直接训练。但代价同样明显:每次压缩-解压缩都会引入不可避免的信息损失,导致生成图像在细节、纹理或色彩一致性上出现失真。PixelDiT的论文直接指出,自编码器是当前图像生成质量天花板的核心瓶颈

PixelDiT的方案可以用“粗暴而优雅”来形容。它采用了一种全新的像素级扩散Transformer(Pixel Diffusion Transformer),通过巧妙的分块注意力机制和层次化采样策略,在参数量与计算量可控的前提下,将扩散过程直接定义在原始像素网格上。实验结果表明,在相同训练数据与计算预算下,PixelDiT生成的图像在FID、LPIPS等指标上显著优于基于潜在空间的同类模型,且视觉检查中几乎消除了“压缩伪影”类缺陷。

这一突破的行业意义在于:它重新打开了“像素级生成”的大门。过去几年,业界曾尝试通过超分辨率、自回归等方法绕开自编码器,但效果始终不如潜在扩散模型。PixelDiT通过Transformer架构的全局感受野和动态权重机制,首次证明了在像素空间直接训练扩散模型不仅可行,而且更优。对于需要高保真输出的场景——如医学影像生成、卫星图像超分、数字人面部细节渲染——这无疑是一剂强心针。

当然,PixelDiT目前仍处在学术验证阶段。论文中使用的最大图像尺寸为512×512,且训练成本虽远低于同等像素级方法,仍比潜在空间模型高出约2-3倍。但考虑到NVIDIA在硬件与系统优化上的积累,这一差距有望快速收窄。可以预见的是,未来两到三年,去自编码器的端到端像素扩散将可能成为新一代图像生成基础设施的核心组件,而PixelDiT正是这一趋势的先行信号。