(论文速读)Diff2Flow:基于扩散模型对齐的训练流匹配模型

论文题目:Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment(Diff2Flow:基于扩散模型对齐的训练流匹配模型)

会议:CVPR2025

摘要:扩散模型通过高保真输出彻底改变了生成性任务,而流匹配(FM)提供了更快的推理和经验性能收益。然而,当前的基础FM模型在计算上限制了精调,而像稳定扩散这样的扩散模型受益于高效的体系结构和生态系统支持。这项工作解决了有效地将知识从预先训练的扩散模型转移到流匹配的关键挑战。我们提出了Diff2Flow,这是一个新的框架,通过重新调整时间步长,对齐内插值,并从扩散预测中获得与FM兼容的速度场,系统地连接了扩散和FM范例。这种对齐实现了扩散先验的直接和高效的FM微调,而不需要额外的计算开销。我们的实验表明,Diff2Flow的性能优于NA?ıve FM和扩散微调,特别是在参数高效的约束下,同时与最先进的方法相比,在不同的下游任务中获得了更好或更具竞争力的性能。

我们将在https://github.上发布我们的代码Com/CompVis/Diff2flow。


Diff2Flow:如何用扩散模型的"遗产"高效训练流匹配模型?

一、背景与动机:两个范式之间的"鸿沟"

近年来,生成式图像模型领域出现了两条并行的技术路线:

扩散模型(Diffusion Models, DM) 以 Stable Diffusion 为代表,凭借高保真度的输出和成熟的生态系统(微调工具、社区资源、高效架构)成为实际部署中的首选。

流匹配模型(Flow Matching, FM) 则是更新的范式,理论上具有更直的概率路径,在推理速度和生成质量上均有实测优势。当前最先进的 FM 基础模型(如 Flux、Stable Diffusion v3)参数量均超过 8B,高端硬件才能运行,微调几乎不可行。

这就带来了一个核心矛盾:FM 更好用,但贵;DM 更成熟,但已是"旧范式"。能不能把 Stable Diffusion 这类预训练扩散模型的知识迁移到 FM,同时保留 FM 的推理优势?

这正是本文要解决的问题。


二、问题的根源:三重错位

看起来,直接把 FM 的训练目标(最小化速度场误差)套在预训练的扩散模型上微调就行了——但实验证明,这样做效果极差,尤其在参数高效微调(LoRA)场景下几乎完全失效。原因在于两个范式之间存在三重本质性错位

错位一:插值方式不同

扩散模型的前向过程(插值)是非线性的,由噪声调度参数 $\alpha_t, \sigma_t$ 决定:

$x^{DM}_{t} = \alpha_t x_0 + \sigma_t \epsilon, \quad \epsilon \sim \mathcal{N}(0, I)$

而流匹配的插值是线性的:

$x^{FM}_{t} = t \cdot x_1 + (1-t) \cdot x_0$

错位二:时间步缩放不同

扩散模型的时间步是离散整数 $t_{DM} \in {0, 1, \ldots, 1000}$,而流匹配使用连续实数 $t_{FM} \in [0, 1]$。两者边界条件含义也相反:扩散模型 t=0 是干净图像,t=T 是纯噪声;流匹配恰好相反,t=1 是数据,t=0 是噪声。

错位三:训练目标(参数化)不同

扩散模型的网络预测的是噪声 $\epsilon$$\epsilon$-参数化)或速度 $v_t$$v$-参数化,$v_t = \alpha_t \epsilon - \sigma_t x_0$),而流匹配的网络直接预测速度场(即 $x_1 - x_0$)。两者输出的语义完全不同。


三、Diff2Flow 方法:三步系统对齐

【论文 Figure 1:Diff2Flow 轨迹对齐示意图,展示扩散轨迹与流匹配轨迹的对应关系,以及速度预测 $\hat{v}$ 的推导过程】

我们引入了一种新的精调技术来在流匹配和扩散之间进行遍历,该技术能够以最少的额外训练有效地对齐这两个过程。流匹配轨迹上的内插值被计算为扩散时间步长t、样本x和相关扩散系数的函数f。我们的方法进一步实现了速度预测$\hat{v}$,而不考虑扩散模型的参数化。

Diff2Flow 的核心思想是:不强迫模型"忘记"旧的参数化,而是建立一套数学映射,把扩散轨迹上的预测"翻译"为流匹配轨迹上的速度场,再用 FM 损失微调。整个框架由三个步骤组成。

步骤一:时间步重缩放(Timestep Rescaling)

定义一个可逆的双向映射 $f_t$,将扩散时间步 $t_{DM}$ 映射到流匹配时间步 $t_{FM}$

$f_t(t_{DM}) = \frac{\alpha_{t_{DM}}}{\alpha_{t_{DM}} + \sigma_{t_{DM}}}$

这个公式非常自然:当 $t_{DM}=0$(干净图像)时,$\alpha \to 1, \sigma \to 0$$f_t \to 1$,对应 FM 的 $t_{FM}=1$(数据端);当 $t_{DM}=T$(纯噪声)时,$\alpha \to 0$$f_t \to 0$,对应 FM 的 $t_{FM}=0$(噪声端)。边界条件完美对齐。

由于扩散模型的 $\alpha_t, \sigma_t$ 只在离散整数时间步定义,而 FM 需要连续时间步,论文在离散点之间做分段线性插值,并发现了一个有趣的现象:

【论文 Figure 2:对比正常整数时间步与平移后非整数时间步($t_{DDIM}+0.5$)的生成结果,说明扩散模型对非训练过的连续时间步依然鲁棒】

尽管扩散模型从未在非整数时间步上训练,直接以 $t_{DDIM} + 0.5$ 为输入的生成质量依然良好。论文推测,正弦位置编码天然构建了连续时间空间。这一发现为轨迹插值奠定了实验基础。

步骤二:插值对齐(Interpolant Alignment)

为了把非线性扩散轨迹上的样本 $x^{DM}{t{DM}}$ 变换为流匹配线性轨迹上的等价点 $x^{FM}{t{FM}}$,定义空间变换 $f_x$

$f_x(x^{DM}{t{DM}}) = \frac{1}{\alpha_{t_{DM}} + \sigma_{t_{DM}}} \cdot x^{DM}{t{DM}}$

这是一个简单的缩放操作,无需任何额外计算。可以验证,变换后的插值恰好满足流匹配的线性插值形式。逆变换(FM → DM)为:

$f_x^{-1}(x^{FM}{t{FM}}) = \left(\alpha_{f_t^{-1}(t_{FM})} + \sigma_{f_t^{-1}(t_{FM})}\right) \cdot x^{FM}{t{FM}}$

步骤三:目标函数统一(Objective Unification)

有了上述两个映射,就可以从扩散模型的预测(v-参数化)直接推导出 FM 所需的速度场。设 $v_\theta(x^{DM}, t_{DM})$ 为预训练扩散模型的 v-预测输出,则对应的 FM 速度场为:

$\mathbf{v}\theta(x^{FM}, t{FM}) = x_1^{FM} - x_0^{FM} = x_0^{DM} - x_T^{DM} = (\alpha_{t_{DM}} - \sigma_{t_{DM}})\left(x^{DM}{t{DM}} - v_\theta(x^{DM}{t{DM}}, t_{DM})\right)$

这个推导无需改变模型的输出头,也无需额外的计算图。同样的方法可以推广到 $\epsilon$-参数化的扩散模型。

完整算法流程

训练阶段(Algorithm 1):给定 FM 时间步 $t_{FM}$、噪声 $x_0^{FM}$ 和数据 $x_1^{FM}$

  1. 按 FM 插值公式计算 $x^{FM}{t{FM}}$
  2. $f_t^{-1}$$t_{FM}$ 映射回 $t_{DM}$
  3. $f_x^{-1}$$x^{FM}{t{FM}}$ 映射回 $x^{DM}{t{DM}}$
  4. 用扩散模型在 $x^{DM}{t{DM}}$ 处做前向推断,得到速度估计 $\hat{\mathbf{v}}_\theta$
  5. 用 FM 损失函数对 $\hat{\mathbf{v}}_\theta$ 做梯度下降

推理阶段(Algorithm 2):每一步 Euler 积分均先将 FM 时间步映射到 DM 时间步,再映射 FM 样本到 DM 轨迹,获取速度预测,最后按 FM 的 Euler 更新公式前进。

与 LoRA 的协同

论文发现,LoRA 在朴素 FM 微调下几乎完全失效:模型需要从扩散参数化切换到速度场预测,这需要大范围更新权重,低秩更新根本无法承载如此剧烈的变化。

而在 Diff2Flow 的对齐框架下,模型无需改变参数化方式,LoRA 只需聚焦于任务本身(如学习深度特征),效果大幅改善。


四、实验:四类任务全面验证

4.1 文本生成图像(Text-to-Image)

实验基于 Stable Diffusion 2.1(768×768 预训练),在 LAION-Aesthetics 数据集上微调至 512×512 分辨率,在 COCO 2017 上评估。

【论文 Figure 5:COCO 2017 FID 收敛曲线,左图为全参数微调,右图为 LoRA 微调,对比 DM、FM、Diff2Flow 三种方法的收敛速度与最终性能】

关键观察:

  • 全参数微调下,FM 和 Diff2Flow 最终收敛到相近性能,但 Diff2Flow 收敛显著更快(约 2.5k 步即可达到 FM 需要更多步才能达到的性能),因为模型无需"从头学习"如何输出速度场
  • LoRA 微调下,差距更加显著:朴素 FM 微调的 LoRA 无法跟上 Diff2Flow,说明参数量受限时,对齐的重要性大幅提升

【论文 Table 1:COCO-2017 5k 量化对比表,包含 FID↓、CLIP↑、Aesthetics Score↑ 三个指标,Diff2Flow 均优于 SD1.5 基线和持续扩散训练】

  • Diff2Flow 取得 FID=52.80,CLIP=26.54,美学分=5.99,全面超越 SD1.5 基线(56.77/26.34/5.32)

附加收益——解决非零终端 SNR 问题

扩散模型存在一个已知缺陷:由于噪声调度的零终端 SNR 问题,模型无法生成真正的纯黑或纯白图像,平均色调会偏灰。Diff2Flow 的线性 FM 轨迹天然没有此问题。

【论文 Figure 4:对比 DM、FM、Diff2Flow 对"纯白图像"和"白底灰圆"提示词的生成结果,展示 Diff2Flow(含/不含 LoRA)能正确生成无灰偏的图像,而 DM 版本明显偏灰】

【论文 Figure 3:定性对比图,展示 DM/FM/Diff2Flow 在相同种子、相同采样步数下的生成质量,包含两个提示词示例(宇航员/猫油画),可直观感受视觉质量差异】

4.2 轨迹矫正(Reflow)

Reflow 是一种通过将噪声-图像对与 ODE 轨迹对齐来"拉直"流匹配采样路径的技术,能大幅减少推理所需步数。本文将 Diff2Flow 与 Reflow 结合,在 Stable Diffusion v1.5 上仅微调 LoRA(62M 参数,不到全参数的 7%)。

【论文 Table 3:Reflow 对比表,各方法在 25/4/2 步推理下的 FID↓ 和 CLIP↑,Diff2Flow(LoRA) 与全参数的 Rectified Flow 相比有竞争力】

核心数据:

  • 25 步推理:Diff2Flow(LoRA) FID=21.45,接近 Rectified Flow 全参数(0.9B)的 21.65
  • 4 步推理:FID=25.29,CLIP=0.313,超过 PeRFlow 全参数的 CLIP=0.294
  • 2 步推理:FID=32.31,CLIP=0.305,优于 Rectified Flow 全参数的 CLIP=0.296

仅用 62M 参数就达到与 900M 参数模型竞争的速度-质量权衡,充分说明对齐的重要性。

【论文 Figure 6:SD1.5 + Diff2Flow-Reflow 的 4 步推理定性结果展示图】

4.3 单目深度估计(Monocular Depth Estimation)

这是验证 Diff2Flow 跨任务泛化能力的核心实验。实验设置与 Marigold 和 DepthFM 相同:在合成图像-深度图数据上(74K 样本)微调,在 5 个真实世界数据集上做零样本评估。

【论文 Table 2:主要对比表,包含 NYUv2/KITTI/ETH3D/ScanNet/DIODE 五个数据集的 AbsRel↓ 和 δ₁↑,对比判别式方法(DAv1/2、Metric3D、Metric3Dv2)和生成式方法(Marigold、GeoWizard、DepthFM、E2E-FT、Lotus-G、Diff2Flow)】

重点对比数据:

方法NYUv2 AbsRel↓KITTI AbsRel↓ETH3D AbsRel↓
DepthFM(74K)6.09.16.5
Marigold(74K)5.59.96.5
Diff2Flow(74K)5.78.75.5(最优)
Diff2Flow(LoRA)(74K)5.99.56.0
  • Diff2Flow 在 KITTI 和 ETH3D 上超过 DepthFM(需要指出,DepthFM 直接用 FM 目标微调,存在三重错位)
  • ETH3D 的 AbsRel=5.5 是所有生成式方法中最优
  • LoRA 版本仅用 222M 参数,在 NYUv2 上达到 AbsRel=5.9,接近全参数 DepthFM(6.0)

【论文 Figure 8:NYUv2 收敛曲线,左图全参数微调,右图 LoRA 微调;横轴为训练迭代数,纵轴为 δ₁-Accuracy;展示 Diff2Flow 在极少训练步后即可超越 DM,在 LoRA 场景下优势更大】

【论文 Figure 7:真实世界图像的定性深度预测对比,展示 DAv1/DAv2/Marigold/E2E-FT/DepthFM/Diff2Flow(LoRA)/Diff2Flow(Full FT) 七种方法的预测结果,Diff2Flow 在细节保留上更为突出】

4.4 参数量消融(Ablation on Trainable Parameters)

【论文 Table 4:NYUv2 零样本评估,对比不同可训练参数量(866M全参/222M LoRA-base/62M LoRA-small)的 AbsRel↓ 和 δ₁↑,同时与 Marigold+E2E-FT(866M)对比】

关键结论:仅用约 1/4 的参数(222M vs 866M),Diff2Flow 就能与全参数的 E2E-FT 方法竞争(AbsRel: 5.9 vs 5.2);即便进一步压缩到 62M,也能达到 AbsRel=6.9,仍有实用价值。


五、方法对比:Diff2Flow vs 朴素FM微调 vs 持续扩散训练

对比维度持续扩散训练(DM)朴素 FM 微调Diff2Flow(本文)
推理速度慢(弯曲轨迹)快(直线轨迹)快(直线轨迹)
收敛速度慢(需重学参数化)快(对齐后无需重学)
LoRA 兼容性极差
终端SNR问题
额外计算开销
Reflow 兼容

六、核心洞察与总结

Diff2Flow 最本质的贡献,是揭示了扩散模型和流匹配模型之间存在一套精确的数学对应关系——通过时间步缩放、插值变换、目标函数推导,可以将一个扩散模型的任意中间状态精确映射到流匹配轨迹上,从而让两个框架的训练目标在数学上完全一致。

这意味着:

  1. 迁移代价极低:无额外计算,无架构修改,只需调整损失函数的计算方式
  2. LoRA 得以解锁:对齐后的框架中,模型不需要"切换范式",低秩更新得以聚焦于真正的任务学习
  3. 广泛适用性:对 $\epsilon$-参数化和 v-参数化均有效,对文本生成图像、深度估计、轨迹矫正等不同任务均有效

对于有大量 Stable Diffusion 生态积累(微调权重、数据集、基础设施)的研究者和工程师而言,Diff2Flow 提供了一条低成本升级到流匹配范式的实用路径,而无需重新依赖数十亿参数的 FM 基础模型。


七、局限性与未来方向

论文本身未详细讨论局限性,但从实验结果可以观察到:

  • LoRA-small(62M)在某些任务上仍与全参数方法有差距,说明参数量仍然是上限
  • 实验基于 Stable Diffusion v1.5/v2.1,对更大规模扩散模型(如 SDXL)的迁移效果尚待验证
  • 本文未覆盖视频生成等序列建模场景

未来可探索的方向包括:将 Diff2Flow 与一致性蒸馏(Consistency Distillation)结合,或用于视频扩散模型到视频流匹配模型的迁移。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

这张生成的图像能检测吗

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值