ICLR 2026|VFScale:利用内在能量函数驱动扩散模型高效搜索

点击蓝字

关注我们

AI TIME欢迎每一位AI爱好者的加入!

西湖大学吴泰霖实验室

  • 论文题目:VFScale: Intrinsic Reasoning through Verifier-Free Test-time Scalable Diffusion Model

  • 论文地址:https://openreview.net/forum?id=8ta0xgtsJK

  • 预印本链接:https://arxiv.org/abs/2502.01989

  • TLDR:受人类 System 2 思考模式启发,人类在解决复杂问题时往往依靠“内在准则”自我修正而非外界实时反馈。为了填补扩散模型在推理侧扩展(Test-time Scaling)上的空白,VFScale 提出了一种无需外部验证器的测试时可扩展扩散模型框架,通过引入单调回归负对比学习(MRNCL)重塑能量地貌以确保能量与样本质量的一致性,并结合混合蒙特卡洛树搜索(hMCTS)策略,从而在无需外部反馈的情况下显著提升了模型在复杂分布外推理任务(如大型迷宫和数独)上的性能。

点击阅读原文查看作者讲解

1

核心贡献

(1) 问题定义

痛点与挑战:现有的扩散模型在推理任务上难以像大语言模型(LLM)那样通过增加测试时计算量(Test-time scaling)来提升性能。主要存在两大瓶颈:

  1. 依赖外部验证器:现有扩展方法通常需要训练好的外部验证器来评估生成质量,这与人类无需外部反馈的“内在推理”机制不符,且高质量验证器往往难以获取。

  2. 搜索效率低下:简单的采样策略(如Best-of-N)效率较低,随着采样数增加性能提升很快遇到瓶颈。

核心目标:提出一种无需外部验证器的框架(VFScale),直接利用扩散模型自身的能量函数作为内在验证器,实现高效的测试时推理扩展。

(2) 核心方法

VFScale 通过改进训练和推理两个阶段,确保能量函数“既准又顺”,并利用它进行高效搜索:

  • 训练端:重塑能量地貌 (Training)

  • MRNCL (单调回归负对比学习):这是核心创新。通过引入一种新的损失函数,强制要求样本的能量值与其到真实解的距离(L2距离)呈线性单调关系。这解决了“性能-能量一致性”问题,确保能量越低,解的质量确实越好。

  • KL 正则化:配合 MRNCL,利用 KL 散度平滑能量地貌,使去噪轨迹更容易收敛到低能量区域。

  • 推理端:混合搜索策略 (Inference)

  • hMCTS (混合蒙特卡洛树搜索):提出了一种分阶段策略。在初始高噪声阶段使用 Best-of-N (BoN) 进行广泛的并行探索,防止过早陷入局部最优;在后续低噪声阶段自适应切换到 MCTS 进行深度的精细搜索。

(3) 实验结果

VFScale 在高难度的推理任务(迷宫和数独)上证明了其强大的分布外(OOD)泛化能力和可扩展性:

  • 分布外泛化性能:

    • 在 Maze (迷宫) 任务中,模型仅在 6x6 的小迷宫上训练,却能成功解决 15x15 的超大迷宫,成功率从基线的 0% 提升至 88%。

    • 在 Sudoku (数独) 任务中,在极少已知数字的困难设定下,解决率达到 43%,显著优于基线的 30%。

  • 测试时可扩展性 (Scalability):

    • 验证了随着推理计算预算(样本数 N)的增加,VFScale 的性能曲线持续上升,打破了传统方法迅速饱和的瓶颈。这证明了模型学会了利用更多计算资源来换取更高的准确率。

2

未来展望

针对测试时扩展(test-time scaling),这个方向本身很大,对于扩散模型或者大语言来说还有蛮多未解之谜和待解决的问题。首先scaling what这个尚有很大探索空间,扩散模型可以有扩展采样步数,扩展噪声分支,renoise等。至于扩展的方式,MCTS很好平衡了探索和利用,但是很慢,计算并行效率还有待提高。私以为,测试时扩展是一定能够提高效果的,关键是斜率(性价比)考量对于解决问题是不是首先。其中的成本不只是生成额外的解这个搜索计算成本,还有评估这个解的成本。现实场景中的评估,时间成本、资源成本和安全性等都是要求非常严苛的,所以无验证器的测试时扩展一定会扮演重要角色。

具体而言,也还在继续思考如下几个方向

  1. 基于计算理论的一些insight,问题的解的计算复杂度可以分为串行计算复杂度和并行计算复杂度,我们在思考能不能用其来指导扩散模型 scaling的方向。也是从Perfect diffusion is TC(0) – Bad diffusion is Turing-complete 2025得到的一些启发?这篇论文的观点是:“完美”的扩散模型在计算上是“浅”的(属于 TC^0 复杂度类),而“坏”的扩散模型则可以是图灵完备的 。作者论证,现实中训练出的扩散模型更接近“完美”而非“坏” ,它们收敛得非常快,计算深度恒定(O(1))。这种“浅”的并行特性导致它们无法解决需要“深度”串行推理的任务(例如困难的数独,这类任务更适合自回归或“思维链”等串行方法 。在这里,比如能不能利用“能量地貌”作为复杂性探针,来更智能引导 test-time scaling?

  2. 固定成本下如何平衡不同扩展维度的取舍?不同阶段,扩展不同的变量带来的增益很可能是不同的,如何更加智能的选择扩展的维度?

  3. 回到心路历程里面期待完成的三个探索或者贡献,如果利用element-wise noise scheudle的方式来统一不同的生成模型(AR和diffusion model),如何才能发现更好的生成模型,如何利用强化学习来优化noise schedule?

  4. 另外,我们也在思考将VFScale的方法应用到其他领域,比如扩散语言模型的训练和推理中,具体来讲,可以将hMCTS用作扩散语言模型的推理时扩展的扩展算法,也可以利用VFSclae的两个训练损失包括MRNCL loss和KL loss来训练更好的reward model。

3

文章之外的研究历程

(1) 缘起:跨越 LLM 与扩散模型的鸿沟

VFScale 的故事最早可以追溯到:如何深度结合大语言模型(尤其是在 OpenAI o1 背景下)与扩散模型这两个领域的知识。尽管扩散模型与基于自回归机制的 LLM 在逻辑地位上并不对等,但我们希望能从中挖掘出跨领域的创新想法。这一方向衍生出了许多思路,并陆续成为组内一两个博士生在 2024 至 2025 年间的科研主旋律。

(2) 核心思考:生成模型也能拥有“思考过程”吗?

我们最初的出发点是:LLM 表现出的“上下文学习”能力,本质上是否属于分布外(OOD)泛化?随后,我们从扩散策略和强化学习领域的研究中获得启发:模型可以通过“缝合”训练轨迹中的子模块来实现泛化,进而生成全新的路径。

对于 LLM 而言,思维链(CoT)中的每一个“想法”就像是一个子模块,模型通过推理侧缩放来增加思维链的长度,从而解决长程逻辑问题。自然地,我们想到:扩散模型是否也可以构建类似的思维链?即实现一种“由粗到细”的生成过程——正如画家作画,先勾勒轮廓,再填充细节。但实验发现,扩散模型的思维链并不像 LLM 那样明确,两者之间存在一定的逻辑错位。

(3) 战略转向:寻找扩散模型的“缩放法则”

经过几轮迭代讨论,我们最终确立了主题:最后确认主题是如何构建一个管线来统一各种生成模型(包括扩散模型,自回归模型等),实现模型能够拆解一个问题的解,然后推理过程中可以通过搜索最后实现OOD泛化。期待完成如下三个探索或者贡献:(1)统一不同的生成模型,给出一个新的设计空间;(2)在新的设计空间给出合理的设计,在训练、推理、可解释性质等某些方面有独特优势;(3)深度从LLM (主要针对AR)或者扩散模型借鉴一些洞察,注入到其他生成模型架构或者我们新开发的生成模型架构中。

在寻找“稳健方案”的过程中,我们衍生出了一个支线任务:暂时撇开复杂的思维链逻辑,单纯验证扩散模型是否也存在推理侧缩放效应?这标志着 VFScale 研究正式进入正轨。

(4) 实验突破:从迷宫任务到算法优化

为了观察明显的提升效果并保持较快的迭代速度,我们放弃了简单的玩具数据集,转而聚焦于推理任务(这与 LLM 的推理研究异曲同工)。我们基于 IRED 代码库开展实验,利用能量扩散模型中“能量值”天然充当“判别器(Verifier)”的优势进行验证。

关于“缩放什么”和“如何缩放”,由于我们已知单纯增加采样步数(NFE)收益微乎其微,因此选择了通过随机采样多个噪声项来扩展不同的生成分支。起初尝试了“最佳采样法(Best-of-N)”,效果平平;随后引入蒙特卡洛树搜索(MCTS)来平衡探索与利用,效果有所提升,但很快遇到了瓶颈。

(5) 诊断与进化:hMCTS 的诞生

经过分析,我们发现了两个关键症结:多样性缺失和判别失效。

具体来讲就是,通过number-of-sample 来scaling的方式,成功与否无非就是两个决定因素,能否产生多样的样本供选择和能否选择到高质量的样本。一方面,我们利用一些指标来测试了生成样本的多样性,发现样本随着采样步数的深入diversity明显下降,基本针对一个给定问题,采样出来的是同一个解;另一方面,我们使用一个真实的verifier来选取产生的不同分支,发现效果有明显提升。 以上的两个方向的实验结果都在告诉我们,这个用来测试时扩展的模型本身有很大提升空间。

针对这些问题,我们提出了 KL 损失和 MRNCL 损失,分别用于提升采样多样性和判别器的准确性。改进后的效果非常显著:在迷宫任务中,无缩放的成功率从 6% 提升至 26%,而配合缩放后直接飙升至 70%。

之后模型本身基本上够我们扩展了,我们后面又发现基本的MCTS还是有一些问题,随着模型前向次数的加大,和基线BoN的差距越来越小。我们调了蛮久的一些超参数,发现始终拉不开差距。后面,秉持“打不过就加入”(bushi)的心态,我们想着分析原因。发现,相同的模型前向次数下,MCTS早期就会做很多分支然后剪切分支,这个对于扩散模型采样过程早期样本噪声很大,即使做很多探索也没有用,一方面影响很小(离最后样本还有很长的去噪过程),另一方面,学到的能量模型作为验证器对于噪声较大的样本评估也不准确。我们想着能不能更加高效地做扩展,一开始尽量不做分支剪支的操作。由此,提出了hMCTS,利用一个超参数ts控制,前ts步使用BoN避免在高噪声阶段分支剪支浪费模型前向次数,ts步之后再使用MCTS充分探索解空间。实验效果很明显,扩展曲线来看,hMCTS基本上没有斜率变缓的趋势。后面基本就是调参数,做ablation study,写作,投稿。

Scaling 的下半场才刚刚开始,你认为扩散模型的 “o1 时刻” 还有多远?评论区见。

Test-time scaling of diffusion model推荐文献:

  • THE SERIAL SCALING HYPOTHESIS  2025 (扩散模型应对串行计算复杂度高的问题也很困难)

  • Inference-time scaling for diffusion models beyond scaling denoising steps 2025 CVPR

  • Inference-Time Compute Scaling For Flow Matching 2510

  • Adaptive Cyclic Diffusion for Inference Scaling 2505

  • A General Framework for Inference-time Scaling and Steering of Diffusion Models ICML 2025

  • Fast Monte Carlo Tree Diffusion: 100x Speedup via Parallel Sparse Planning 2506

  • Constraints-Guided Diffusion Reasoner for Neuro-Symbolic Learning 2508

  • Compositional Monte Carlo Tree Diffusion for Extendable Planning 2510

  • Inference-time alignment in diffusion models with reward-guided generation: Tutorial and review 2025

  • Remasking discrete diffusion models with inference-time scaling NeurIPS 2025

  • Inference-time scaling of diffusion models through classical search 2025

  • Monte Carlo Tree Diffusion with Multiple Experts for Protein Design 2025

  • Monte carlo tree diffusion for system 2 planning 2025

  • Inference-time scaling of diffusion language models with particle gibbs sampling 2025

  • Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling 2025 NeurIPS

  • When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning COLM 2025

作者介绍

本文作者为西湖大学吴泰霖实验室博士生张涛、潘嘉书:

张涛,吴泰霖实验室二年级博士生,主攻生成模型,致力于开发生成理解统一框架以及用生成模型解决物理系统的控制难题,是一个乒乓球爱好者和电影迷。

潘嘉书,吴泰霖实验室一年级博士生,志向是用科学的方法论解释和开发智能,喜欢表示学习,生成模型和物理。闲暇时,为了放开吃东西,也是一个跑者。

吴泰霖实验室研究AI for Science,具体为开发生成模型及用于能源、水下具身智能和生命科学中的仿真和控制,正在招收博士生、博后、实习生,详情见tailin.org。

西湖大学吴泰霖组介绍

西湖大学吴泰霖实验室2027级博士生招生|博后/暑期/长期实习同步开放

往期精彩文章推荐


 关于AI TIME 

AI TIME源起于2019年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球AI学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。

迄今为止,AI TIME已经邀请了2000多位海内外讲者,举办了逾800场活动,超1000万人次观看。

我知道你

在看

提出观点,表达想法,欢迎

留言

点击 阅读原文 观看作者直播回放!

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值