高斯过程为昂贵的贝叶斯积分加速混合蒙特卡罗
0. 总结
混合蒙特卡洛 (HMC) 通常是计算难以解析的贝叶斯积分的首选方法。然而,这种方法的成功可能需要对(未归一化的)后验及其偏导数进行大量评估。在后验计算成本高昂的情况下,这可能导致 HMC 的计算负载不可接受。我建议对 HMC 所需的大多数计算使用后验(对数)的高斯过程模型。在这个方案中,即使 GP 模型有些不准确,也只需要偶尔评估实际的后验,以确保生成的样本具有完全期望的分布。该方法在 10 维问题上进行了演示,其中 200 次评估足以从后验生成 100 个大致独立的点。因此,所提出的方案允许对具有后验计算要求的模型进行贝叶斯处理,例如涉及计算机模拟的模型。
关键词:高斯过程; 马尔科夫链蒙特卡罗; 混合蒙特卡罗;非参数模型; 衍生过程; 正交; 设计。
1. 介绍
积分评估是贝叶斯推理的核心:wrt 积分。后验可以用于预测和对似然wrt进行积分。先验用于获得模型比较的边际似然。后者通常比前者更困难,因为先验通常相当广泛并且可能性非常高。在本文中,我们考虑前者,并将参考后验 wrt。我们希望将其积分为目标密度。
对于许多有趣的统计模型,直接分析积分是不可能的,所以经常使用马尔可夫链蒙特卡罗 (MCMC) 方法。简单形式的 MCMC 可能需要对目标密度进行大量评估才能产生可靠的结果。主要原因之一是目标密度往往表现出变量之间的强依赖关系,使得目标密度高的区域形成狭窄的扩展流形;这种流形被分解成几个不同的区域(多模态)的情况更加困难,这里不再具体讨论。
目标密度中变量之间的强依赖关系可能是大多数贝叶斯推理问题的典型特征,流形内的扩展方向对应于观测数据的可能解释族。积分wrt。与基于点估计的范式相比,这些不确定性是贝叶斯处理的主要优点之一。
变量之间的强相关性使得难以探索目标密度,同时保持在高概率区域内。在后验本身在计算上需要评估的情况下,这使得简单的 MCMC 方案不切实际。计算要求苛刻的后验出现在几种情况下:1)分层模型,其中较低层次的层次已被整合以减少参数数量,通常会导致其余参数的复杂后验,以及 2)使用计算机模拟作为整体的模型其规范的一部分,例如对于许多地球物理或气象应用来说是典型的。在这些情况下,对单个点的目标密度的评估本身就需要计算。在这种情况下,显然我们需要尽可能有效地使用从每次评估中获得的信息。
本文提出的新方法是对 Duane 等人的 Hybrid Monte Carlo (HMC) 方法的详细说明。 (1987),使用高斯过程 (GP) 模型来指导搜索并避免对目标密度函数的过多引用。 O’Hagan (1991) 以前曾建议使用高斯过程模型来评估积分,称为 Bayes-Hermite 求积,另见优秀的 O’Hagan (1992)。在该方法中,引入了“重要性”密度,并使用高斯过程对被积函数乘以后验密度和重要性密度的比率进行建模。对于分析的易处理性,重要性密度必须是正常的,尽管肯尼迪 (1998) 放宽了这一要求。正如我们将看到的,当前的方法试图解决完全相同的问题,但方式却截然不同。 Duane 等人的混合蒙特卡罗 (HMC) 方法。 (1987)是一种相当普遍适用的方法,通过抑制(低效)随机游走行为,从高度相关的密度中更有效地采样。尽管 HMC 通常比依赖随机游走的采样方案快得多,但它仍可能需要对目标密度进行大量评估。在本文中,我提出了对 HMC 的扩展,它允许进一步减少目标评估的数量。关键思想是在大多数计算中使用目标密度的近似模型,并且仅偶尔需要评估真实目标;这是以这样一种方式完成的,即生成的样本将具有完全期望的分布;相关思想参见 Neal (1996) 的第 3.5 节和 Liu (2001) 的第 9 章。本文的其余部分结构如下。在第 2 节中讨论了寻求抑制随机游走的动机,并概述了混合蒙特卡罗方法。在第 3 节中,回顾了高斯过程模型的一些结果,包括对函数导数的观察值进行调节。新算法在第 4 节中给出,并在几个简单问题上展示了它的性能。结论和进一步讨论在第 5 节中给出。
2. 随机游走方法与混合蒙特卡罗
在高度相关的分布中,依赖随机游走的采样方法在探索目标密度方面效率低下。使用大小为 sss 的步长,使用随机游走移动一段距离 LLL 需要预期的 L2/s2L^2/s^2L2/s2 步,因为轨迹通常会自行折叠。这在图 1 中的一个简单的二元正态情况下进行了说明,用于非常常用的吉布斯抽样和 Metropolis 抽样方法。
由于典型的步长被限制在最窄方向的数量级以便获得良好的接受概率(严格来说,这仅适用于 D>2D > 2D>2 维; 在 D=2D = 2D=2 维中,接受率仅随提案宽度线性下降,因此最佳宽度是两个方向中较长的一个。 所以图 1 在这方面有点误导。),随着相关强度的增加,随机游走的二次探索时间将导致性能下降。 Gibbs 采样算法的情况类似。这个问题最直接的解决方案是进行变量转换以消除强依赖关系,但对于贝叶斯推理中遇到的复杂分布,这可能非常困难。其他方法包括 Neal (1998b) 的有序过松弛方案和混合蒙特卡洛算法,可以看作是生成 Metropolis 提议的更精细的方法。
Neal (1993) 在统计设置中回顾了 HMC 算法。在 HMC 中引入了一个虚构的动力系统,其中变量 θθθ 被解释为位置,并由一组“动量”变量 ϕ\phiϕ 增强。 Metropolis 提案是通过虚拟时间模拟动力系统提出的。由于物理系统中的动量,随机游走被抑制。物理系统的能量通过通常的二元性与概率相关:
因此,势能 EpotE_{pot}Epot 与我们希望从中采样的目标分布 p(θ)p(θ)p(θ) 相关。 动能与动量的平方有关。 注意 θθθ 和ϕ\phiϕ 因素的联合概率成为独立部分; 因此,我们可以通过从关节采样并忽略动量从 p(θ)p(θ)p(θ) 中获取样本。
在恒定总能量 HHH 下,系统通过虚构时间的演化由 Hamilton 方程控制:

不幸的是,对于大多数目标密度,方程 (2) 是耦合的非线性微分方程(涉及对数后验参数的偏导数),我们无法以封闭形式求解。 相反,我们通过迭代一阶步骤来近似解决方案:

在实践中,我们使用稍微修改过的“跨越式”方案,将前半步作为动量,然后对位置和动量进行全步迭代,最后再对动量进行半步; 这样做是为了使近似可逆(Metropolis 步骤的详细平衡需要)。
Hybrid Monte Carlo 的完整


6532

被折叠的 条评论
为什么被折叠?



