(论文速读)DECO:用于端到端图像生成的频率解耦像素扩散

论文题目:DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation(DECO:用于端到端图像生成的频率解耦像素扩散)

会议:CVPR 2026

摘要:像素扩散的目标是以端到端的方式在像素空间中直接生成图像。该方法避免了VAE在两阶段潜扩散中的局限性,提供了较高的模型容量。现有的像素扩散模型存在训练和推理速度慢的问题,因为它们通常在单个扩散转换器(DiT)内对高频信号和低频语义进行建模。为了追求更有效的像素扩散范式,我们提出了频率解耦的像素扩散框架。凭借分离高频和低频分量的直觉,我们利用一个轻量级像素解码器来生成高频细节,条件是来自DiT的语义指导。这样,DiT就可以专门为低频语义建模。此外,我们引入了频率感知的流匹配损耗,它强调视觉上显著的频率,而抑制不显著的频率。大量实验表明,在像素扩散模型中,DECO具有较好的性能,在ImageNet上的FID分别为1.62(256×256)和2.22(512×512),缩小了与潜在扩散方法的差距。此外,我们的预先训练的文本到图像模型在系统级比较中获得了领先的总体分数0.86。

代码可在https://github.com/Zehong-Ma/DeCo.上公开获取


DeCo 关注的是 Pixel Diffusion。与主流 Latent Diffusion 先通过 VAE 将图像压缩到 latent space 再进行扩散不同,Pixel Diffusion 直接在像素空间完成生成,因此能够避开 VAE 重建质量和 latent distribution 带来的限制。不过,直接在高维像素空间建模也会带来明显问题:现有方法通常让一个 DiT 同时学习低频语义和高频信号,而复杂的高频信息,尤其是高频噪声,不仅难学,还会干扰 DiT 对低频语义的建模。

针对这一问题,论文提出 DeCo(Frequency-DeCoupled Pixel Diffusion):让 DiT 主要负责低频语义建模,再使用一个轻量级 Pixel Decoder 根据 DiT 提供的语义条件恢复高频细节。同时,作者提出 Frequency-aware Flow-Matching Loss,利用 JPEG Quantization Table 提供的视觉先验,对不同频率赋予不同权重。

最终,DeCo 在 ImageNet 256×256 和 512×512 上分别取得 FID 1.62 和 2.22;Text-to-Image 模型在 GenEval 上取得 Overall 0.86。

论文 Figure 1:DeCo 在 512×512 Text-to-Image 任务上的生成结果。


1. 论文解决的问题

Latent Diffusion 的优势是将图像压缩到低维 latent space 后再进行扩散,能够显著减少计算量,但最终生成质量会受到 VAE 重建能力限制。Pixel Diffusion 则完全去掉 VAE,直接从像素空间学习数据分布:

Noise → Pixel Diffusion Model → RGB Image

这种方式更加直接,但像素空间的维度非常高。作者进一步指出,问题不仅是“输入维度高”,而是 DiT 同时承担了两类性质不同的任务

  • 低频部分主要表示物体、布局、形状和全局语义;

  • 高频部分包含纹理、边缘、局部细节以及大量高频噪声。

传统 Pixel Diffusion 通常将单尺度输入 patchify 后直接送入 DiT,因此低频和高频都需要由同一个 Transformer 建模。高频信号尤其是高频噪声比较难学习,同时会分散 DiT 的模型容量,使其难以专注于更重要的低频语义。

论文 Figure 2:传统 Pixel Diffusion 与 DeCo 的对比。Baseline 使用单个 DiT 同时学习低频语义和高频信号;DeCo 将二者交给不同模块处理。

论文的核心思路因此很直接:

DiT            → Low-Frequency Semantics
Pixel Decoder  → High-Frequency Signals

2. DeCo 方法

2.1 整体框架

DeCo 对不同频率采用不同分辨率的输入。

首先,当前 diffusion state x_t 经过下采样和 patchify 后输入 DiT。由于下采样本身会抑制一部分高频信息,因此 DiT 更容易专注于低频语义。论文中 Baseline 和 DeCo 的 DiT input patch size 都设置为 16。

DiT 输出为:

x_{\mathrm{low}}=\mathrm{DiT}(\bar{x}_t,t,y)

其中 t 为 diffusion time,y 为类别标签或文本条件,x_{low} 表示 DiT 输出的低频语义特征。

随后,Pixel Decoder 同时接收完整分辨率的 x_t 和来自 DiT 的 x_{low},预测最终的 pixel velocity:

v_{\theta}(x_t,t,y)=\mathrm{Dec}(x_t,t,x_{\mathrm{low}})

这样,DiT 不再需要直接承担高频细节建模,而 Pixel Decoder 可以利用 full-resolution input 恢复纹理和局部信息。

论文 Figure 3:DeCo 完整框架。DiT 对低分辨率输入建模低频语义,Pixel Decoder 在 DiT 语义条件下利用完整分辨率输入预测 Pixel Velocity。

2.2 Lightweight Pixel Decoder

Pixel Decoder 是一个 attention-free 的轻量网络,由多个 Linear、MLP 和 AdaLN 模块构成,不使用高分辨率 self-attention。

首先将完整分辨率的 x_t 与位置编码 pos 拼接,得到 dense query:

h_0=W_{\mathrm{in}}(\mathrm{Concat}(x_t,pos))

其维度为:

h_0\in\mathbb{R}^{B\times H\times W\times d}

默认情况下 d=32。

随后将 DiT 输出 x_{low} 上采样到与 Pixel Decoder 相同的空间尺寸,并通过 MLP 生成 AdaLN 的调制参数:

\alpha,\beta,\gamma=\mathrm{MLP}(\sigma(x_{\mathrm{low}}^{\mathrm{up}}+t))

Decoder Block 的更新形式为:

h_N=h_{N-1}+\alpha\ast\mathrm{MLP}((1+\gamma)\ast h_{N-1}+\beta)

这里 DiT 的输出并不是简单与 Pixel Decoder 特征相加,而是作为语义条件通过 AdaLN 调制高频特征。

论文默认 Pixel Decoder 的 hidden size 为 32、depth 为 3,总参数量仅约 8.5M。


3. Frequency-aware Flow-Matching Loss

除了从网络结构上完成频率解耦,论文还认为传统 Flow Matching 对所有频率一视同仁并不合理。

标准 Conditional Flow Matching 中,x0 表示真实图像,x1 表示噪声,其线性轨迹为:

x_t=(1-t)x_0+t x_1

对应的真实 velocity 为:

v_t=x_1-x_0

标准 Flow-Matching Loss 为:

\mathbb{E}{x_t,t,y} \left[ \left| v{\theta}(x_t,t,y)-v_t \right|_2^2 \right]

问题是,这种 pixel-level MSE 默认所有频率的误差同样重要。

DeCo 借鉴 JPEG 的 Quantization Table。JPEG 的量化规则本身包含视觉先验:人眼对不同频率的敏感程度不同。因此,作者先将 predicted velocity 和 ground-truth velocity 从 RGB 转换到 YCbCr,然后执行 8×8 block-wise DCT:

V_{\theta}=T(v_{\theta}(x_t,t,y))V_t=T(v_t)

随后根据 JPEG Quantization Table 生成不同频率的 a daptive weight:

w= \frac{1/Q_{\mathrm{cur}}} {\mathbb{E}(1/Q_{\mathrm{cur}})}

当 JPEG quality q 位于 50 到 100 时:

\max \left( 1, \left\lfloor \frac{Q_{\mathrm{base}}\cdot(100-q)+25}{50} \right\rfloor \right)

最终 Frequency-aware FM Loss 为:

\mathbb{E}{x_t,t,y} \left[ w \left| V{\theta}-V_t \right|_2^2 \right]

最终训练目标为:

\mathcal{L}{\mathrm{FM}} + \mathcal{L}{\mathrm{FreqFM}} + \mathcal{L}_{\mathrm{REPA}}

其中 L_REPA 来自论文 Baseline 使用的 REPA representation alignment。

简单来说,DeCo 的 Loss 设计就是:更重视视觉上重要的频率,同时适当减弱不重要高频噪声对训练的影响。


4. DeCo 是否真的完成了频率解耦?

作者进一步分析了 DiT Output 和 Pixel Velocity 的 DCT energy distribution。

论文 Figure 4:Baseline 与 DeCo 的 DCT Energy Distribution。统计基于 10K images、所有 diffusion steps,并使用 8×8 DCT。

可以看到,与 Baseline 相比:

  • DeCo 的 DiT Output 中高频 energy 明显降低;

  • 最终 Pixel Velocity 中仍然保留了较强的高频 energy。

这说明 DeCo 并不是直接删除高频信息,而是成功将高频建模任务从 DiT 转移到了 Pixel Decoder:

Baseline:
DiT → Low Frequency + High Frequency

DeCo:
DiT → Low Frequency
Pixel Decoder → High Frequency

这也是论文对 Frequency Decoupling 最直接的实验验证。


5. 实验结果

5.1 与 Baseline 的对比

论文首先在 ImageNet 256×256 上进行 200K iterations 的对比实验。DeCo 的关键结构修改是使用 Pixel Decoder 替换 Baseline 最后的两个 DiT Blocks。

论文 Table 1:DeCo 与 Baseline、PixDDT、PixNerd、PixelFlow、JiT+REPA 等方法的比较。

Baseline 的 FID 为 61.10、IS 为 16.81。

仅加入 frequency-decoupled architecture、但不使用 L_{FreqFM} 后:

FID:61.10 → 34.12
IS:16.81 → 46.44

加入 Frequency-aware FM Loss 后,完整 DeCo 达到:

FID:31.35
sFID:9.34
IS:48.35
Recall:0.65

可以看出,架构上的 Frequency Decoupling 是最主要的性能增益来源,Frequency-aware FM Loss 又在此基础上进一步降低 FID。

5.2 训练效率

论文 Figure 5:DeCo 与 Baseline 的 FID-50K 随 Training Iteration 的变化。

DeCo 在 400K iterations 时即可达到 FID 2.57,而 Baseline 大约训练到 4.0M iterations 才达到相近的 FID 2.59。

因此论文所说的 10× faster,主要指达到相近 FID 所需要的训练迭代数约降低 10 倍,而不是单个 iteration 快 10 倍。实际上 Table 1 中 Baseline 为 0.22 s/it,DeCo 为 0.24 s/it。

5.3 ImageNet Class-to-Image

论文 Figure 6:DeCo 在 ImageNet 256×256 上的 Class-to-Image 生成结果。

论文 Table 2:ImageNet 256×256 和 512×512 上的 Class-to-Image 结果。

在 ImageNet 256×256 上,DeCo-XL/16 训练 800 epochs、使用 250×2 NFE 时取得:

FID:1.62
sFID:4.41
IS:301
Precision:0.80
Recall:0.62

在 ImageNet 512×512 上,DeCo-XL/16 取得:

FID:2.22
sFID:4.67
IS:290.0
Precision:0.80
Recall:0.60

其中 256×256 的 FID 1.62 和 512×512 的 FID 2.22 都是论文重点强调的 Pixel Diffusion 结果,使端到端 Pixel Diffusion 与 Two-Stage Latent Diffusion 的差距进一步缩小。

5.4 Text-to-Image

论文 Table 3:DeCo 在 GenEval 和 DPG-Bench 上的 Text-to-Image 结果。

DeCo-XXL/16 参数量为 1.1B,在 512×512 Text-to-Image 上取得:

GenEval Overall:0.86
DPG-Bench:81.4

GenEval 各子项为:

Single Object:1.00
Two Object:0.92
Counting:0.72
Colors:0.91
Position:0.80
Color Attribution:0.79

其中 GenEval Overall 0.86 高于论文表中 SD3 的 0.68、FLUX.1-dev 的 0.67、BLIP3o 的 0.81 和 OmniGen2 的 0.80。

需要注意的是,DPG-Bench 的 81.4 并不是表中最高结果,因此这里更适合描述为“有竞争力”,而不是 SOTA。


6. 消融实验

论文 Table 4:Pixel Decoder 结构以及 Frequency-aware FM Loss 的消融实验。

Pixel Decoder hidden size:

d=16:FID 37.63
d=32:FID 34.12
d=64:FID 35.88

最佳为 d=32。

Pixel Decoder depth:

N=1:FID 37.10
N=3:FID 34.12
N=6:FID 35.46

最佳为 N=3。

Pixel Decoder patch size:

Patch Size=1:FID 31.35
Patch Size=4:FID 34.39
Patch Size=16:FID 55.59

这一组实验非常关键。Pixel Decoder 使用 full-resolution、pixel-level input 时效果最好,而使用与 DiT 类似的大 patch 后性能明显下降,验证了 Multi-Scale Input Strategy 对高频建模的重要性。

DiT 与 Pixel Decoder 的交互:

AdaLN:FID 31.35
Add:FID 36.02

说明将 DiT Output 作为 semantic condition 进行 AdaLN modulation,比简单的 feature addition 更有效。

对于 Frequency-aware FM Loss,loss weight=1 时结果最好;JPEG quality 的实验中:

q=50:FID 31.54
q=85:FID 31.35
q=100:FID 33.84

论文最终使用 q=85。


7. 总结

DeCo 解决 Pixel Diffusion 问题的思路并不复杂:不要再让一个 DiT 同时负责所有频率。

传统 Pixel Diffusion 中:

DiT → Low-Frequency Semantics + High-Frequency Signals

DeCo 则将任务拆开:

DiT → Low-Frequency Semantics
Pixel Decoder → High-Frequency Signals

DiT 使用低分辨率输入专注语义建模,轻量 Pixel Decoder 直接使用 full-resolution noisy image 恢复局部高频信息;随后再使用基于 JPEG perceptual prior 的 Frequency-aware FM Loss,对视觉上更重要的 frequency component 给予更高权重。

从消融实验来看,论文最主要的提升来自 frequency-decoupled architecture:FID 从 Baseline 的 61.10 直接下降到 34.12;Frequency-aware FM Loss 进一步将 FID 降到 31.35。

最终 DeCo 在 ImageNet 256×256 和 512×512 上分别达到 FID 1.62 和 2.22,并在 GenEval 上取得 Overall 0.86。

个人认为,这篇论文最值得关注的点不是 DCT 或 JPEG 本身,而是它重新分配了 Pixel Diffusion 中不同模块的任务:让 Transformer 做更擅长的全局低频语义建模,让轻量 Pixel Decoder 处理局部高频细节。

MMSE简易智能精神状态检查量表 姓名:_____________ 性别:_______ 年龄:_______ 文化程度:__________ ______ 评定时间:_________年___月_____日_____时~_____时 既往病史:_________________ _____ " " " "记 " " " " " " "录 " " " " " " " "错 "正 " " " " " "误 "确 " "I定向力 "时间 "星期几 " "0 "1 " "10分 "定向 " " " " " " "(问现在是) " " " " " " " "几号 " "0 "1 " " " "几月 " "0 "1 " " " "什么季节 " "0 "1 " " " "哪一年? " "0 "1 " " "地点 "哪家医院 " "0 "1 " " "定向 " " " " " " "(问您现在是在) " " " " " " " "第几层楼 " "0 "1 " " " "哪个街道或乡 " "0 "1 " " " "哪个城市 " "0 "1 " " " "哪个国家 " "0 "1 " "II即刻记忆力"连续说出这三样东西后提 "窗子 " "0 "1 " "3分 "问 " " " " " " " "国旗 " "0 "1 " " " "胶布 " "0 "1 " "III注意力和 "要求病人从100开始减7后 "100-7=93 " "0 "1 " "计算力 "得出答案 " " " " " "5分 " " " " " " " " "93-7=86 " "0 "1 " " " "86-7=79 " "0 "1 " " " "79-7=72 " "0 "1 " " " "72-7=65 " "0 "1 " "IV短程记忆力"刚才说的三样东西是什么 "窗子 " "0 "1 " "3分 " " " " " " " " "国旗 " "0 "1 " " " "胶布 " "0 "1 " "V语言能力 "物体 "(拿出手表)请问这是" "0 "1 " "9分 "命名 "什么? " " " " " " "(拿出铅笔)请问这是" "0 "1 " " " "什么? " " " " " "复述 "重复"四十四只石狮子"" "0 "1 " " "三步 "右手拿纸 " "0 "1 " " "命令 " " " " " " " "用双手把纸对折 " "0 "1 " " " "将纸放在你的大腿上 " "0 "1 " " "阅读 "按纸张上"闭上您的眼 " "0 "1 " " " "睛"做 " " " " " "表达 "说一句有主语、动词的" "0 "1 " " " "完整的话 " " " " " "结构 "图形描画:2个交汇的 " "0 "1 " " " "五边形 " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " 《MMSE简易智能精神状态检查量表》操作说明 (以第一次答案记分) 本检查量表是根据中华医学会《行为医学量表手册》,结合相关文献和工作实际整理 ,量表的评分只能作为协助评估患者走失风险的参考,疾病的诊断需结合临床,遵从医 生嘱托。 I.定向力(时间与地点定向,最高分:10分) 首先依次询问日期,再依次询问地点。以患者首次答案进行记录。 II.即刻记忆力(最高分:3分) 向患者清楚、连续、缓慢地说出3个相互无关的东西的名称(如:窗子、国旗、胶布 ,大约1秒钟说一个),不要求被试者按物品次序回答。如第一遍有错误,先记分,然后 ,再告诉被试错在哪里,并再请他回忆,但重复的次数不能超过5次。如果5次后他们仍 未记住所有的3个名称,则跳过IV部分不再检查"回忆能力"。 III.注意力和计算力(最高分:5分) 要求病人从100开始减7,之后再减7,一直减5次,不得用笔计算。每答对1个得1分 ,如果前次错了,但下一个答案是对的,也得1分,如,100-7=93(正确,得分),93- 7=88(错误,不得分)但如从88-7=81(正确,得分)。 IV.短程记忆力(回忆能力,最高分:3分) 如果前次被测试者完全记住了3个无关东西名称(窗子、国旗、胶布),现在就让他 再重复一遍。每正确重复1个得1分。 V.语言能力(最高分:9分) 1. 命名能力(0-2分):分别拿出手表、铅笔问"这是什么?"。 2. 复述能力(0- 1分):要求被测试者注意你说的话并重复一次,注意只允许重复一次。这句话是"四十 四只石狮子",只有正确,咬字清楚的才记1分。 3. 三步命令(0- 3分):给被测试者一张空白的平纸,要求对方按你的命令去做,注意不要重复或示范。 只有他按正确顺序做的动作才算正确,每个正确动作计1
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

这张生成的图像能检测吗

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值