论文题目:DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation(DECO:用于端到端图像生成的频率解耦像素扩散)
会议:CVPR 2026
摘要:像素扩散的目标是以端到端的方式在像素空间中直接生成图像。该方法避免了VAE在两阶段潜扩散中的局限性,提供了较高的模型容量。现有的像素扩散模型存在训练和推理速度慢的问题,因为它们通常在单个扩散转换器(DiT)内对高频信号和低频语义进行建模。为了追求更有效的像素扩散范式,我们提出了频率解耦的像素扩散框架。凭借分离高频和低频分量的直觉,我们利用一个轻量级像素解码器来生成高频细节,条件是来自DiT的语义指导。这样,DiT就可以专门为低频语义建模。此外,我们引入了频率感知的流匹配损耗,它强调视觉上显著的频率,而抑制不显著的频率。大量实验表明,在像素扩散模型中,DECO具有较好的性能,在ImageNet上的FID分别为1.62(256×256)和2.22(512×512),缩小了与潜在扩散方法的差距。此外,我们的预先训练的文本到图像模型在系统级比较中获得了领先的总体分数0.86。
代码可在https://github.com/Zehong-Ma/DeCo.上公开获取
DeCo 关注的是 Pixel Diffusion。与主流 Latent Diffusion 先通过 VAE 将图像压缩到 latent space 再进行扩散不同,Pixel Diffusion 直接在像素空间完成生成,因此能够避开 VAE 重建质量和 latent distribution 带来的限制。不过,直接在高维像素空间建模也会带来明显问题:现有方法通常让一个 DiT 同时学习低频语义和高频信号,而复杂的高频信息,尤其是高频噪声,不仅难学,还会干扰 DiT 对低频语义的建模。
针对这一问题,论文提出 DeCo(Frequency-DeCoupled Pixel Diffusion):让 DiT 主要负责低频语义建模,再使用一个轻量级 Pixel Decoder 根据 DiT 提供的语义条件恢复高频细节。同时,作者提出 Frequency-aware Flow-Matching Loss,利用 JPEG Quantization Table 提供的视觉先验,对不同频率赋予不同权重。
最终,DeCo 在 ImageNet 256×256 和 512×512 上分别取得 FID 1.62 和 2.22;Text-to-Image 模型在 GenEval 上取得 Overall 0.86。

论文 Figure 1:DeCo 在 512×512 Text-to-Image 任务上的生成结果。
1. 论文解决的问题
Latent Diffusion 的优势是将图像压缩到低维 latent space 后再进行扩散,能够显著减少计算量,但最终生成质量会受到 VAE 重建能力限制。Pixel Diffusion 则完全去掉 VAE,直接从像素空间学习数据分布:
Noise → Pixel Diffusion Model → RGB Image
这种方式更加直接,但像素空间的维度非常高。作者进一步指出,问题不仅是“输入维度高”,而是 DiT 同时承担了两类性质不同的任务:
-
低频部分主要表示物体、布局、形状和全局语义;
-
高频部分包含纹理、边缘、局部细节以及大量高频噪声。
传统 Pixel Diffusion 通常将单尺度输入 patchify 后直接送入 DiT,因此低频和高频都需要由同一个 Transformer 建模。高频信号尤其是高频噪声比较难学习,同时会分散 DiT 的模型容量,使其难以专注于更重要的低频语义。

论文 Figure 2:传统 Pixel Diffusion 与 DeCo 的对比。Baseline 使用单个 DiT 同时学习低频语义和高频信号;DeCo 将二者交给不同模块处理。
论文的核心思路因此很直接:
DiT → Low-Frequency Semantics
Pixel Decoder → High-Frequency Signals
2. DeCo 方法
2.1 整体框架
DeCo 对不同频率采用不同分辨率的输入。
首先,当前 diffusion state 经过下采样和 patchify 后输入 DiT。由于下采样本身会抑制一部分高频信息,因此 DiT 更容易专注于低频语义。论文中 Baseline 和 DeCo 的 DiT input patch size 都设置为 16。
DiT 输出为:
其中 t 为 diffusion time,y 为类别标签或文本条件, 表示 DiT 输出的低频语义特征。
随后,Pixel Decoder 同时接收完整分辨率的 和来自 DiT 的
,预测最终的 pixel velocity:
这样,DiT 不再需要直接承担高频细节建模,而 Pixel Decoder 可以利用 full-resolution input 恢复纹理和局部信息。

论文 Figure 3:DeCo 完整框架。DiT 对低分辨率输入建模低频语义,Pixel Decoder 在 DiT 语义条件下利用完整分辨率输入预测 Pixel Velocity。
2.2 Lightweight Pixel Decoder
Pixel Decoder 是一个 attention-free 的轻量网络,由多个 Linear、MLP 和 AdaLN 模块构成,不使用高分辨率 self-attention。
首先将完整分辨率的 与位置编码
pos 拼接,得到 dense query:
其维度为:
默认情况下 d=32。
随后将 DiT 输出 上采样到与 Pixel Decoder 相同的空间尺寸,并通过 MLP 生成 AdaLN 的调制参数:
Decoder Block 的更新形式为:
这里 DiT 的输出并不是简单与 Pixel Decoder 特征相加,而是作为语义条件通过 AdaLN 调制高频特征。
论文默认 Pixel Decoder 的 hidden size 为 32、depth 为 3,总参数量仅约 8.5M。
3. Frequency-aware Flow-Matching Loss
除了从网络结构上完成频率解耦,论文还认为传统 Flow Matching 对所有频率一视同仁并不合理。
标准 Conditional Flow Matching 中,x0 表示真实图像,x1 表示噪声,其线性轨迹为:
对应的真实 velocity 为:
标准 Flow-Matching Loss 为:
问题是,这种 pixel-level MSE 默认所有频率的误差同样重要。
DeCo 借鉴 JPEG 的 Quantization Table。JPEG 的量化规则本身包含视觉先验:人眼对不同频率的敏感程度不同。因此,作者先将 predicted velocity 和 ground-truth velocity 从 RGB 转换到 YCbCr,然后执行 8×8 block-wise DCT:
,
随后根据 JPEG Quantization Table 生成不同频率的 a daptive weight:
当 JPEG quality q 位于 50 到 100 时:
最终 Frequency-aware FM Loss 为:
最终训练目标为:
其中 L_REPA 来自论文 Baseline 使用的 REPA representation alignment。
简单来说,DeCo 的 Loss 设计就是:更重视视觉上重要的频率,同时适当减弱不重要高频噪声对训练的影响。
4. DeCo 是否真的完成了频率解耦?
作者进一步分析了 DiT Output 和 Pixel Velocity 的 DCT energy distribution。

论文 Figure 4:Baseline 与 DeCo 的 DCT Energy Distribution。统计基于 10K images、所有 diffusion steps,并使用 8×8 DCT。
可以看到,与 Baseline 相比:
-
DeCo 的 DiT Output 中高频 energy 明显降低;
-
最终 Pixel Velocity 中仍然保留了较强的高频 energy。
这说明 DeCo 并不是直接删除高频信息,而是成功将高频建模任务从 DiT 转移到了 Pixel Decoder:
Baseline:
DiT → Low Frequency + High Frequency
DeCo:
DiT → Low Frequency
Pixel Decoder → High Frequency
这也是论文对 Frequency Decoupling 最直接的实验验证。
5. 实验结果
5.1 与 Baseline 的对比
论文首先在 ImageNet 256×256 上进行 200K iterations 的对比实验。DeCo 的关键结构修改是使用 Pixel Decoder 替换 Baseline 最后的两个 DiT Blocks。

论文 Table 1:DeCo 与 Baseline、PixDDT、PixNerd、PixelFlow、JiT+REPA 等方法的比较。
Baseline 的 FID 为 61.10、IS 为 16.81。
仅加入 frequency-decoupled architecture、但不使用 后:
FID:61.10 → 34.12
IS:16.81 → 46.44
加入 Frequency-aware FM Loss 后,完整 DeCo 达到:
FID:31.35
sFID:9.34
IS:48.35
Recall:0.65
可以看出,架构上的 Frequency Decoupling 是最主要的性能增益来源,Frequency-aware FM Loss 又在此基础上进一步降低 FID。
5.2 训练效率

论文 Figure 5:DeCo 与 Baseline 的 FID-50K 随 Training Iteration 的变化。
DeCo 在 400K iterations 时即可达到 FID 2.57,而 Baseline 大约训练到 4.0M iterations 才达到相近的 FID 2.59。
因此论文所说的 10× faster,主要指达到相近 FID 所需要的训练迭代数约降低 10 倍,而不是单个 iteration 快 10 倍。实际上 Table 1 中 Baseline 为 0.22 s/it,DeCo 为 0.24 s/it。
5.3 ImageNet Class-to-Image

论文 Figure 6:DeCo 在 ImageNet 256×256 上的 Class-to-Image 生成结果。

论文 Table 2:ImageNet 256×256 和 512×512 上的 Class-to-Image 结果。
在 ImageNet 256×256 上,DeCo-XL/16 训练 800 epochs、使用 250×2 NFE 时取得:
FID:1.62
sFID:4.41
IS:301
Precision:0.80
Recall:0.62
在 ImageNet 512×512 上,DeCo-XL/16 取得:
FID:2.22
sFID:4.67
IS:290.0
Precision:0.80
Recall:0.60
其中 256×256 的 FID 1.62 和 512×512 的 FID 2.22 都是论文重点强调的 Pixel Diffusion 结果,使端到端 Pixel Diffusion 与 Two-Stage Latent Diffusion 的差距进一步缩小。
5.4 Text-to-Image

论文 Table 3:DeCo 在 GenEval 和 DPG-Bench 上的 Text-to-Image 结果。
DeCo-XXL/16 参数量为 1.1B,在 512×512 Text-to-Image 上取得:
GenEval Overall:0.86
DPG-Bench:81.4
GenEval 各子项为:
Single Object:1.00
Two Object:0.92
Counting:0.72
Colors:0.91
Position:0.80
Color Attribution:0.79
其中 GenEval Overall 0.86 高于论文表中 SD3 的 0.68、FLUX.1-dev 的 0.67、BLIP3o 的 0.81 和 OmniGen2 的 0.80。
需要注意的是,DPG-Bench 的 81.4 并不是表中最高结果,因此这里更适合描述为“有竞争力”,而不是 SOTA。
6. 消融实验

论文 Table 4:Pixel Decoder 结构以及 Frequency-aware FM Loss 的消融实验。
Pixel Decoder hidden size:
d=16:FID 37.63
d=32:FID 34.12
d=64:FID 35.88
最佳为 d=32。
Pixel Decoder depth:
N=1:FID 37.10
N=3:FID 34.12
N=6:FID 35.46
最佳为 N=3。
Pixel Decoder patch size:
Patch Size=1:FID 31.35
Patch Size=4:FID 34.39
Patch Size=16:FID 55.59
这一组实验非常关键。Pixel Decoder 使用 full-resolution、pixel-level input 时效果最好,而使用与 DiT 类似的大 patch 后性能明显下降,验证了 Multi-Scale Input Strategy 对高频建模的重要性。
DiT 与 Pixel Decoder 的交互:
AdaLN:FID 31.35
Add:FID 36.02
说明将 DiT Output 作为 semantic condition 进行 AdaLN modulation,比简单的 feature addition 更有效。
对于 Frequency-aware FM Loss,loss weight=1 时结果最好;JPEG quality 的实验中:
q=50:FID 31.54
q=85:FID 31.35
q=100:FID 33.84
论文最终使用 q=85。
7. 总结
DeCo 解决 Pixel Diffusion 问题的思路并不复杂:不要再让一个 DiT 同时负责所有频率。
传统 Pixel Diffusion 中:
DiT → Low-Frequency Semantics + High-Frequency Signals
DeCo 则将任务拆开:
DiT → Low-Frequency Semantics
Pixel Decoder → High-Frequency Signals
DiT 使用低分辨率输入专注语义建模,轻量 Pixel Decoder 直接使用 full-resolution noisy image 恢复局部高频信息;随后再使用基于 JPEG perceptual prior 的 Frequency-aware FM Loss,对视觉上更重要的 frequency component 给予更高权重。
从消融实验来看,论文最主要的提升来自 frequency-decoupled architecture:FID 从 Baseline 的 61.10 直接下降到 34.12;Frequency-aware FM Loss 进一步将 FID 降到 31.35。
最终 DeCo 在 ImageNet 256×256 和 512×512 上分别达到 FID 1.62 和 2.22,并在 GenEval 上取得 Overall 0.86。
个人认为,这篇论文最值得关注的点不是 DCT 或 JPEG 本身,而是它重新分配了 Pixel Diffusion 中不同模块的任务:让 Transformer 做更擅长的全局低频语义建模,让轻量 Pixel Decoder 处理局部高频细节。
DECO:用于端到端图像生成的频率解耦像素扩散&spm=1001.2101.3001.5002&articleId=163591997&d=1&t=3&u=6f08cbdeb8864715a0738536151dbd1b)
397

被折叠的 条评论
为什么被折叠?



