生成式AI领域的扩散模型正在经历一次关键转向。NVIDIA Research入选CVPR2026最佳论文决赛的PixelDiT,直接挑战了当前主流范式——潜在扩散模型(LDM)的根基。该工作彻底移除自编码器,让DiT(Diffusion Transformer)直接在高维像素空间中完成去噪过程,标志着图像生成向“真·端到端”迈进了一大步。
自编码器并非完美无损。此前的Stable Diffusion、DALL·E 2等模型依赖预训练自编码器将图像压缩至潜在空间,再执行扩散;但任何有损压缩都会引入不可逆的细节失真。PixelDiT的设计理念是:既然DiT架构已具备处理高维序列的能力,为何还要忍受自编码器的瓶颈?通过将像素视为序列直接建模,模型得以保留原始信号的全部信息,理论上可将生成质量推至新边界。
然而,直接操作像素意味着计算复杂度呈指数级增长。一张256×256的RGB图像包含196,608个token(每个像素对应3个通道值),远超ViT或DiT通常处理的硬件限制。NVIDIA团队如何破解这一难题?据公开信息推测,PixelDiT可能结合了分块策略、掩码训练以及混合精度并行流水线,才使得在现有GPU集群上训练像素级DiT成为可能。若其效果在更大尺寸上稳定,将为4K/8K级高清生成扫清结构障碍。
对比来看,LDM的优势在于计算效率,而PixelDiT押注的是信息完整性。在文本到图像生成、可控编辑等任务中,编解码造成的色彩偏移、纹理模糊等问题长期被归因于扩散过程不足,但PixelDiT揭示了一个更深层的真相:瓶颈或许始于压缩环节。该方法的成功验证了一个假设——当足够强大的Transformer直接学习像素分布时,自编码器的存在反而限制了模型的上限。
行业需要警惕的是,PixelDiT目前尚属研究阶段,其推理速度、显存消耗等工程指标尚未公开。但登顶CVPR2026最佳论文决赛已说明学界对“删除自编码器”路线的高度认可。对于从业者而言,这一趋势意味着:①预训练自编码器不再是扩散模型的必选项;②Transformer序列模型的能力边界远超预期;③高质量图像的“信息损失”问题有望从源头解决。
未来,像素级扩散可能首先在专业图像生成(如医学影像、卫星图)领域落地,随后向通用文生图渗透。NVIDIA这一枪,或许将改写生成式模型的基础架构史。