无约束优化问题
一、无约束优化问题
1. 问题基本形式
针对凸且二阶可微的目标函数,无约束优化问题的数学形式定义为:
minf(x)
\min f(x)
minf(x)
其中,f(x)f(x)f(x)满足“凸性”与“二阶可微性”这两个核心前提假设、。
2. 最优性条件
无约束优化问题达到最优解x∗x^*x∗的核心必要条件为:
∇f(x∗)=0
\nabla f(x^*) = 0
∇f(x∗)=0
即最优解处函数的梯度(一阶导数)等于零向量;若该等式无法直接求解,则需通过迭代方法逼近最优解、。
3. 核心求解框架(下山法迭代格式)
下山法通过迭代构造严格递减的函数值序列以逼近最优解,其数学化迭代流程如下:
- 初始设定:给定初始迭代点x(0)x^{(0)}x(0),初始化迭代次数k=0k=0k=0;
- 方向选取:确定第kkk次迭代的搜索方向Δx(k)\Delta x^{(k)}Δx(k)(后续需进一步优化方向选取规则);
- 步长选取:确定第kkk次迭代的步长α>0\alpha > 0α>0(后续需进一步优化步长选取规则);
- 迭代更新:按以下公式更新迭代点:
x(k+1)=x(k)+αΔx(k) x^{(k+1)} = x^{(k)} + \alpha \Delta x^{(k)} x(k+1)=x(k)+αΔx(k)
同时更新迭代次数k←k+1k \leftarrow k+1k←k+1,且需满足函数值严格递减条件:
f(x(0))>f(x(1))>f(x(2))>…
f(x^{(0)}) > f(x^{(1)}) > f(x^{(2)}) > \dots
f(x(0))>f(x(1))>f(x(2))>…
。
综上,无约束优化问题的核心数学转化目标为:通过数学规则确定“搜索方向Δx(k)\Delta x^{(k)}Δx(k)”与“步长α\alphaα”,使上述迭代流程满足严格递减性并收敛至最优解。
二、搜索方向的确定
视角1:线性化与下降条件
-
梯度L-Lipschitz条件:若函数fff的梯度满足L-Lipschitz连续性,等价于:
∥∇f(x)−∇f(y)∥2≤L∥x−y∥2 \| \nabla f(x)-\nabla f(y)\| _{2} \leq L\| x-y\| _{2} ∥∇f(x)−∇f(y)∥2≤L∥x−y∥2
其中LLL为Lipschitz常数,∥⋅∥2\|\cdot\|_2∥⋅∥2表示欧氏范数。 -
函数线性化不等式:利用基本定理与Cauchy–Schwarz公式,可推导出函数在点xxx处的线性化上界:
f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22 f(x+\Delta) \leq f(x)+\nabla f(x)^{\top} \Delta+\frac{L}{2}\| \Delta\| _{2}^{2} f(x+Δ)≤f(x)+∇f(x)⊤Δ+2L∥Δ∥22
推导不等式f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22f(x+\Delta) \leq f(x)+\nabla f(x)^{\top} \Delta+\frac{L}{2}\| \Delta\| _{2}^{2}f(x+Δ)≤f(x)+∇f(x)⊤Δ+2L∥Δ∥22
梯度L-Lipschitz连续性
(推导的基础,保证梯度变化有界)
∥∇f(x)−∇f(x+tΔ)∥2≤L⋅∥tΔ∥2=Lt∥Δ∥2(t∈[0,1]) \|\nabla f(x) - \nabla f(x + t\Delta)\|_2 \leq L \cdot \|t\Delta\|_2 = L t \|\Delta\|_2 \quad (t \in [0,1]) ∥∇f(x)−∇f(x+tΔ)∥2≤L⋅∥tΔ∥2=Lt∥Δ∥2(t∈[0,1])多元微积分基本定理
f(x+Δ)−f(x)=∫01∇f(x+tΔ)⊤Δ dt f(x+\Delta) - f(x) = \int_{0}^{1} \nabla f\left(x + t\Delta\right)^{\top} \Delta \, dt f(x+Δ)−f(x)=∫01∇f(x+tΔ)⊤Δdt
积分拆分与线性项提取
∫01∇f(x+tΔ)⊤Δdt=∇f(x)⊤Δ⋅∫01dt+∫01[∇f(x+tΔ)−∇f(x)]⊤Δdt \int_{0}^{1} \nabla f(x + t\Delta)^{\top}\Delta dt = \nabla f(x)^{\top}\Delta \cdot \int_{0}^{1} dt + \int_{0}^{1} \left[\nabla f(x + t\Delta) - \nabla f(x)\right]^{\top}\Delta dt ∫01∇f(x+tΔ)⊤Δdt=∇f(x)⊤Δ⋅∫01dt+∫01[∇f(x+tΔ)−∇f(x)]⊤Δdt
其中第一部分积分结果直接为线性项:
∇f(x)⊤Δ⋅∫01dt=∇f(x)⊤Δ \nabla f(x)^{\top}\Delta \cdot \int_{0}^{1} dt = \nabla f(x)^{\top}\Delta ∇f(x)⊤Δ⋅∫01dt=∇f(x)⊤ΔCauchy-Schwarz不等式+L-Lipschitz条件
(控制第二部分积分,得到“二次项L2∥Δ∥22\frac{L}{2}\|\Delta\|_2^22L∥Δ∥22”)
- 由Cauchy-Schwarz不等式:[∇f(x+tΔ)−∇f(x)]⊤Δ≤∥∇f(x+tΔ)−∇f(x)∥2⋅∥Δ∥2\left[\nabla f(x + t\Delta) - \nabla f(x)\right]^{\top}\Delta \leq \|\nabla f(x + t\Delta) - \nabla f(x)\|_2 \cdot \|\Delta\|_2[∇f(x+tΔ)−∇f(x)]⊤Δ≤∥∇f(x+tΔ)−∇f(x)∥2⋅∥Δ∥2
- 代入L-Lipschitz条件并积分:
∫01∥∇f(x+tΔ)−∇f(x)∥2⋅∥Δ∥2dt≤∫01Lt∥Δ∥22dt=L2∥Δ∥22 \int_{0}^{1} \|\nabla f(x + t\Delta) - \nabla f(x)\|_2 \cdot \|\Delta\|_2 dt \leq \int_{0}^{1} L t \|\Delta\|_2^2 dt = \frac{L}{2}\|\Delta\|_2^2 ∫01∥∇f(x+tΔ)−∇f(x)∥2⋅∥Δ∥2dt≤∫01Lt∥Δ∥22dt=2L∥Δ∥22
合并得到最终不等式
f(x+Δ)−f(x)≤∇f(x)⊤Δ+L2∥Δ∥22 ⟹ f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22 f(x+\Delta) - f(x) \leq \nabla f(x)^{\top}\Delta + \frac{L}{2}\|\Delta\|_2^2 \implies f(x+\Delta) \leq f(x) + \nabla f(x)^{\top}\Delta + \frac{L}{2}\|\Delta\|_2^2 f(x+Δ)−f(x)≤∇f(x)⊤Δ+2L∥Δ∥22⟹f(x+Δ)≤f(x)+∇f(x)⊤Δ+2L∥Δ∥22
- 下降方向核心结论:令Δ=αp\Delta=\alpha pΔ=αp(α>0\alpha>0α>0为步长,ppp为搜索方向),只要满足特定条件,就存在足够小的α>0\alpha>0α>0使函数值降低——这是下降方向的充要条件。其中,最自然的搜索方向选择为负梯度方向:
pgd=−∇f(x) p_{gd}=-\nabla f(x) pgd=−∇f(x)
视角2:一般范数下的“最速下降”
-
范数与对偶范数:对任意范数∥⋅∥\|\cdot\|∥⋅∥及其对应的对偶范数∥⋅∥∗\|\cdot\|_*∥⋅∥∗,“最速下降方向”需通过求解以下优化问题得到:
p∗=argmin∥d∥∗≤1∇f(x)⊤d p^{*}=\arg \min _{\| d\| _{*} \leq 1} \nabla f(x)^{\top} d p∗=arg∥d∥∗≤1min∇f(x)⊤d -
最优方向解:上述优化问题的解为:
p∗=−∇f(x)∥∇f(x)∥ p^{*}=-\frac{\nabla f(x)}{\| \nabla f(x)\| } p∗=−∥∇f(x)∥∇f(x) -
特殊范数案例:
- 当使用欧氏范数时,对偶范数与原范数一致,此时p∗p^*p∗即为负梯度方向(与前文中结论一致);
- 若使用Hessian度量(定义为∥d∥H(x)=d⊤H(x)d\|d\|_{H(x)}=\sqrt{d^{\top} H(x) d}∥d∥H(x)=d⊤H(x)d,H(x)H(x)H(x)为函数fff在xxx处的Hessian矩阵),则“最速”方向等价于Newton步(详见后续Newton法相关内容)。
函数fff在点xxx沿方向ddd的局部下降速度,由梯度与方向的内积∇f(x)⊤d\nabla f(x)^\top d∇f(x)⊤d决定:
-
内积越小(越负),函数沿ddd下降越快;
-
因此“找最速下降方向”,等价于在约束∥d∥∗≤1\|d\|_* \leq 1∥d∥∗≤1(对偶范数单位球)下,求解:
p∗=argmin∥d∥∗≤1∇f(x)⊤d p^* = \arg\min_{\|d\|_* \leq 1} \nabla f(x)^\top d p∗=arg∥d∥∗≤1min∇f(x)⊤d
设a=∇f(x)a = \nabla f(x)a=∇f(x),需先确定a⊤da^\top da⊤d(即∇f(x)⊤d\nabla f(x)^\top d∇f(x)⊤d)的最小可能值。
根据对偶范数的核心性质:对任意满足∥d∥∗≤1\|d\|_* \leq 1∥d∥∗≤1的ddd,有:
a⊤d≥−∥a∥ a^\top d \geq -\|a\| a⊤d≥−∥a∥
方向p∗=−∇f(x)∥∇f(x)∥p^* = -\frac{\nabla f(x)}{\|\nabla f(x)\|}p∗=−∥∇f(x)∥∇f(x),既满足对偶范数单位球约束,又能让内积达到最小(下降最快),因此它就是单位球上的最速下降方向。
3. 预条件化的作用
最速下降方向是 “当前范数下,使内积∇f(x)⊤d\nabla f(x)^\top d∇f(x)⊤d最小(下降最快)的方向”。预条件化的本质是改变 “范数度量标准”:不再用欧氏范数,而是用 “预条件范数”
-
二次函数场景:考虑二次目标函数
f(x)=12x⊤Ax−b⊤x(A≻0) f(x)=\frac{1}{2} x^{\top} A x-b^{\top} x \quad (A \succ 0) f(x)=21x⊤Ax−b⊤x(A≻0)
其等高线为椭圆(AAA为正定矩阵,决定椭圆的形状与方向)。 -
预条件化核心操作:通过坐标变换y=A1/2xy=A^{1/2} xy=A1/2x,可将原椭圆等高线“拉成”圆形(即消除椭圆的“细长”特性),这一过程称为预条件化。
-
直观意义:预条件化相当于将优化问题中的“细长谷”地形转化为“圆形洼地”,从而缓解负梯度下降时容易出现的“楼梯形”迂回路径,提升迭代效率。
三、如何确定步长
设线搜索的核心目标函数为ϕ(α)=f(x+αp)\phi(\alpha) = f(x + \alpha p)ϕ(α)=f(x+αp),其中xxx为当前迭代点,ppp为已确定的搜索方向,α≥0\alpha \geq 0α≥0为待求解的步长(需满足函数值下降条件f(x+αp)<f(x)f(x + \alpha p) < f(x)f(x+αp)<f(x))。以下分别介绍三种主流线搜索方法:
1. 精确线搜索(Exact Line Search)
1.1 核心定义
精确线搜索直接求解“使ϕ(α)\phi(\alpha)ϕ(α)最小化”的步长α∗\alpha^*α∗,数学表达为:
α∗=argminα≥0ϕ(α)
\alpha^{*} = \arg \min _{\alpha \geq 0} \phi(\alpha)
α∗=argα≥0minϕ(α)
其目标是找到“当前方向下最优的步长”,理论上能让单次迭代的函数值下降幅度最大。
1.2 二次函数的封闭解
若目标函数为二次函数f(x)=12x⊤Ax−b⊤xf(x) = \frac{1}{2} x^\top A x - b^\top xf(x)=21x⊤Ax−b⊤x(其中A≻0A \succ 0A≻0,即AAA为正定矩阵),且搜索方向p=−∇f(x)=−gp = -\nabla f(x) = -gp=−∇f(x)=−g(g=∇f(x)g = \nabla f(x)g=∇f(x)为当前梯度),则精确线搜索的步长有封闭解:
α∗=g⊤gg⊤Ag
\alpha^{*} = \frac{g^\top g}{g^\top A g}
α∗=g⊤Agg⊤g
该解的本质是:在二次函数的近似下,使“更新后的梯度∇f(x+αp)\nabla f(x + \alpha p)∇f(x+αp)与搜索方向ppp垂直”(即一次更新在二次近似意义上最有效),等价于求解argminα∥g−αAg∥22\arg \min _{\alpha} \|g - \alpha A g\|_2^2argminα∥g−αAg∥22。
1.3 与固定步长的比较
在函数满足 L-光滑性(梯度L-Lipschitz连续)的前提下,精确线搜索得到的α∗\alpha^*α∗至少不劣于固定步长α=1/L\alpha = 1/Lα=1/L(固定步长仅能保证“函数值下降”,但无法保证下降幅度最优)。
2. 黄金分割(Golden Section Search)
2.1 适用场景
当目标函数ϕ(α)\phi(\alpha)ϕ(α)是单峰函数(即区间内仅有一个最小值点),且计算梯度(或导数ϕ′(α)\phi'(\alpha)ϕ′(α))代价高、难度大时,采用黄金分割法通过“区间收缩”逼近最优步长α∗\alpha^*α∗。
2.2 核心流程
-
初始区间设定:确定初始搜索区间[a,b][a, b][a,b],满足ϕ(0)<ϕ(b)\phi(0) < \phi(b)ϕ(0)<ϕ(b)(保证最小值点在区间内,因α=0\alpha=0α=0对应当前点,函数值最大),初始令a=0a=0a=0;
-
区间收缩规则:
-
在区间[a,b][a, b][a,b]内选取两个对称点t1t_1t1和t2t_2t2(a<t1<t2<ba < t_1 < t_2 < ba<t1<t2<b),两点间距与区间总长的比例为“黄金分割系数”c=12(5−1)≈0.618c = \frac{1}{2}(\sqrt{5} - 1) \approx 0.618c=21(5−1)≈0.618,即:
t1=a+(1−c)(b−a),t2=a+c(b−a) t_1 = a + (1 - c)(b - a), \quad t_2 = a + c(b - a) t1=a+(1−c)(b−a),t2=a+c(b−a) -
比较函数值:
- 若ϕ(t2)>ϕ(t1)\phi(t_2) > \phi(t_1)ϕ(t2)>ϕ(t1):说明最小值点α∗∈[a,t2]\alpha^* \in [a, t_2]α∗∈[a,t2],令新区间为[a,t2][a, t_2][a,t2];
- 若ϕ(t1)>ϕ(t2)\phi(t_1) > \phi(t_2)ϕ(t1)>ϕ(t2):说明最小值点α∗∈[t1,b]\alpha^* \in [t_1, b]α∗∈[t1,b],令新区间为[t1,b][t_1, b][t1,b];
-
-
迭代收敛:重复步骤2,不断收缩区间,直到区间长度小于预设精度。最终区间内的任意点均可作为α∗\alpha^*α∗的近似值,收敛误差上界与0.618k0.618^k0.618k成正比(kkk为迭代次数)。
2.3 特点
优点:无需计算梯度/导数,仅通过函数值比较即可迭代;
缺点:收敛速度较慢(线性收敛),仅适用于单峰函数。
3. 回溯搜索(Backtracking Line Search)与 Armijo–Wolfe 准则
3.1 核心准则(Armijo + Wolfe)
回溯搜索通过“先试后调”的方式确定步长,需满足两个核心条件(保证步长既“足够大”以加速收敛,又“足够小”以保证函数值下降):
-
Armijo 条件(充分下降条件):确保步长能使函数值显著下降,数学表达为:
f(x+αp)≤f(x)+c1α∇f(x)⊤p f(x + \alpha p) \leq f(x) + c_1 \alpha \nabla f(x)^\top p f(x+αp)≤f(x)+c1α∇f(x)⊤p
其中0<c1<10 < c_1 < 10<c1<1(通常取c1=10−4c_1 = 10^{-4}c1=10−4),∇f(x)⊤p<0\nabla f(x)^\top p < 0∇f(x)⊤p<0(因ppp为下降方向),右边项为函数值的“预期下降下限”。 -
Wolfe 条件(曲率条件):确保步长不会过小(避免收敛过慢),数学表达为:
∇f(x+αp)⊤p≥c2∇f(x)⊤p \nabla f(x + \alpha p)^\top p \geq c_2 \nabla f(x)^\top p ∇f(x+αp)⊤p≥c2∇f(x)⊤p
其中c1<c2<1c_1 < c_2 < 1c1<c2<1(通常取c2=0.9c_2 = 0.9c2=0.9),该条件要求“更新后的梯度与搜索方向的内积”不小于“初始梯度与搜索方向内积”的c2c_2c2倍,避免步长停留在“函数值下降缓慢的区域”。
3.2 回溯搜索算法流程
给定后退因子β∈(0,1)\beta \in (0, 1)β∈(0,1)(通常取β=0.5\beta = 0.5β=0.5或0.80.80.8),步骤如下:
- 初始步长尝试:令初始步长α←1\alpha \leftarrow 1α←1(默认从“单位步长”开始,适配 Newton 法等需要大步长的场景);
- 条件判断与步长调整:若当前α\alphaα不满足 Armijo 条件( Armijo–Wolfe 联合条件),则按比例缩小步长:α←βα\alpha \leftarrow \beta \alphaα←βα;
- 终止:重复步骤2,直到α\alphaα满足预设条件,输出最终步长α\alphaα。
3.3 关键性质与应用
- 终止性:由 Descent Lemma(f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22f(x+\Delta) \leq f(x) + \nabla f(x)^\top \Delta + \frac{L}{2}\|\Delta\|_2^2f(x+Δ)≤f(x)+∇f(x)⊤Δ+2L∥Δ∥22)可证明:当α\alphaα足够小时,Armijo 条件必成立,因此回溯搜索一定能终止;
- 与 Newton 法的结合(两阶段收敛):
- 阶段 I(远离最优解时):α<1\alpha < 1α<1,通过回溯调整步长进入“可接受域”(满足 Armijo–Wolfe 条件);
- 阶段 II(靠近最优解时):步长会触发α=1\alpha = 1α=1(单位步长),此时 Newton 法可实现二次收敛(收敛速度远快于梯度下降)。
四、收敛率:强凸 / PL 条件与“楼梯现象”
1. 强凸 + L-光滑:线性收敛
-
核心前提:目标函数f(x)f(x)f(x)需同时满足两大性质:
-
强凸性:存在常数μ>0\mu > 0μ>0,对任意迭代点xxx,其Hessian矩阵(二阶导数矩阵)满足下界约束:
μI⪯∇2f(x) \mu I \preceq \nabla^2 f(x) μI⪯∇2f(x)
(“强凸”保证函数有唯一最小值点,且函数形态“下凸程度”可控); -
L-光滑性:存在常数L>0L > 0L>0,对任意迭代点xxx,其Hessian矩阵满足上界约束:
∇2f(x)⪯LI \nabla^2 f(x) \preceq L I ∇2f(x)⪯LI
(“L-光滑”保证函数曲率不超过阈值,梯度变化平缓,避免局部剧烈波动)。
-
-
收敛公式:当步长取α=1/L\alpha = 1/Lα=1/L时,梯度下降迭代满足严格的线性收敛性质:
-
函数值下降界(每次迭代函数值必递减且幅度可控):
f(xk+1)≤f(xk)−12L∥∇f(xk)∥22 f(x_{k+1}) \leq f(x_k) - \frac{1}{2L} \|\nabla f(x_k)\|_2^2 f(xk+1)≤f(xk)−2L1∥∇f(xk)∥22根据这个公式进行推导即可:f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22f(x+\Delta) \leq f(x) + \nabla f(x)^{\top}\Delta + \frac{L}{2}\|\Delta\|_2^2f(x+Δ)≤f(x)+∇f(x)⊤Δ+2L∥Δ∥22
其中Δ=αp\Delta = \alpha pΔ=αp,p=−∇f(x)p=-\nabla f(x)p=−∇f(x)为下降方向
-
迭代点误差界(x∗x^*x∗为函数最优解,与最优解的距离按固定比例缩小):
∥xk+1−x∗∥22≤(1−μL)∥xk−x∗∥22 \|x_{k+1} - x^*\|_2^2 \leq \left(1 - \frac{\mu}{L}\right) \|x_k - x^*\|_2^2 ∥xk+1−x∗∥22≤(1−Lμ)∥xk−x∗∥22
要证明该迭代误差界,需以函数的强凸性、L-光滑性及已证的函数值下降界为核心依据,通过“迭代误差与函数值差的关联”逐步推导,具体步骤如下:
一、明确核心前提与已有结论
在证明前,需明确2个关键性质(强凸+L-光滑)的推论,及1个已证结论:
-
强凸性的核心推论
若函数fff强凸(存在μ>0\mu>0μ>0,使μI⪯∇2f(x)\mu I \preceq \nabla^2 f(x)μI⪯∇2f(x)),则对任意迭代点xxx与最优解x∗x^*x∗(满足∇f(x∗)=0\nabla f(x^*)=0∇f(x∗)=0),有:
f(x)−f(x∗)≥μ2∥x−x∗∥22(1) f(x) - f(x^*) \geq \frac{\mu}{2}\|x - x^*\|_2^2 \tag{1} f(x)−f(x∗)≥2μ∥x−x∗∥22(1)
(强凸性保证“函数值与最优值的差距”不小于“迭代点与最优解距离平方”的固定倍数,建立误差与函数值差的关联)同时,强凸性还可推出“梯度范数与函数值差的关系”:
因为∇f(x∗)=0\nabla f(x^*)=0∇f(x∗)=0,
f(x∗)≥f(x)+∇f(x)⊤(x∗−x)+μ2∣x∗−x∣2. f(x^*)\ge f(x)+\nabla f(x)^{\top}(x^*-x)+\frac{\mu}{2}|x^*-x|^2. f(x∗)≥f(x)+∇f(x)⊤(x∗−x)+2μ∣x∗−x∣2.
移项:
f(x)−f(x∗)≤∇f(x)⊤(x−x∗)−μ2∣x−x∗∣2.(B) f(x)-f(x^*)\le\nabla f(x)^{\top}(x-x^*)-\frac{\mu}{2}|x-x^*|^2. \tag{B} f(x)−f(x∗)≤∇f(x)⊤(x−x∗)−2μ∣x−x∗∣2.(B)
由 Cauchy–Schwarz:
∇f(x)⊤(x−x∗)≤∣∇f(x)∣⋅∣x−x∗∣.\nabla f(x)^{\top}(x-x^*) \le |\nabla f(x)|\cdot|x-x^*|.∇f(x)⊤(x−x∗)≤∣∇f(x)∣⋅∣x−x∗∣.
令右侧关于∣x−x∗∣|x-x^*|∣x−x∗∣的表达最小化,可视为二次函数
∣∇f(x)∣⋅∣x−x∗∣−μ2∣x−x∗∣2. |\nabla f(x)|\cdot|x-x^*|-\frac{\mu}{2}|x-x^*|^2. ∣∇f(x)∣⋅∣x−x∗∣−2μ∣x−x∗∣2.
其最大值出现在∣x−x∗∣=∣∇f(x)∣μ|x-x^*|=\frac{|\nabla f(x)|}{\mu}∣x−x∗∣=μ∣∇f(x)∣,代入得
f(x)−f(x∗)≤12μ∣∇f(x)∣2. f(x)-f(x^*)\le \frac{1}{2\mu}|\nabla f(x)|^2. f(x)−f(x∗)≤2μ1∣∇f(x)∣2.∥∇f(x)∥22≥2μ(f(x)−f(x∗))(2) \|\nabla f(x)\|_2^2 \geq 2\mu(f(x) - f(x^*)) \tag{2} ∥∇f(x)∥22≥2μ(f(x)−f(x∗))(2)
(梯度大小能反映函数值与最优值的差距,为后续替换梯度项做准备)
-
已证的函数值下降界
由L-光滑性(梯度L-Lipschitz连续)及步长α=1/L\alpha=1/Lα=1/L,已证明函数值满足:
f(xk+1)≤f(xk)−12L∥∇f(xk)∥22(3) f(x_{k+1}) \leq f(x_k) - \frac{1}{2L}\|\nabla f(x_k)\|_2^2 \tag{3} f(xk+1)≤f(xk)−2L1∥∇f(xk)∥22(3)
二、步骤1:推导函数值差的线性衰减关系
将式(3)变形为“相邻迭代的函数值差下界”:
f(xk)−f(xk+1)≥12L∥∇f(xk)∥22 f(x_k) - f(x_{k+1}) \geq \frac{1}{2L}\|\nabla f(x_k)\|_2^2 f(xk)−f(xk+1)≥2L1∥∇f(xk)∥22
将强凸性推论式(2)(∥∇f(xk)∥22≥2μ(f(xk)−f(x∗))\|\nabla f(x_k)\|_2^2 \geq 2\mu(f(x_k) - f(x^*))∥∇f(xk)∥22≥2μ(f(xk)−f(x∗)))代入上式,替换梯度范数项:
f(xk)−f(xk+1)≥12L⋅2μ(f(xk)−f(x∗)) f(x_k) - f(x_{k+1}) \geq \frac{1}{2L} \cdot 2\mu(f(x_k) - f(x^*)) f(xk)−f(xk+1)≥2L1⋅2μ(f(xk)−f(x∗))
化简后得到“函数值差的衰减关系”:
f(xk)−f(xk+1)≥μL(f(xk)−f(x∗)) f(x_k) - f(x_{k+1}) \geq \frac{\mu}{L}(f(x_k) - f(x^*)) f(xk)−f(xk+1)≥Lμ(f(xk)−f(x∗))
进一步整理,将函数值差聚焦到“与最优值的差距”:
f(xk+1)−f(x∗)≤f(xk)−f(x∗)−μL(f(xk)−f(x∗)) f(x_{k+1}) - f(x^*) \leq f(x_k) - f(x^*) - \frac{\mu}{L}(f(x_k) - f(x^*)) f(xk+1)−f(x∗)≤f(xk)−f(x∗)−Lμ(f(xk)−f(x∗))f(xk+1)−f(x∗)≤(1−μL)(f(xk)−f(x∗))(4) f(x_{k+1}) - f(x^*) \leq \left(1 - \frac{\mu}{L}\right)\left(f(x_k) - f(x^*)\right) \tag{4} f(xk+1)−f(x∗)≤(1−Lμ)(f(xk)−f(x∗))(4)
式(4)表明:迭代中“函数值与最优值的差距”按(1−μ/L)(1 - \mu/L)(1−μ/L)的比例线性衰减。
三、步骤2:将函数值差衰减转化为迭代误差衰减
利用强凸性推论式(1),分别对xk+1x_{k+1}xk+1和xkx_kxk建立“迭代误差与函数值差的关联”:
-
对xk+1x_{k+1}xk+1:
∥xk+1−x∗∥22≤2μ(f(xk+1)−f(x∗))(5) \|x_{k+1} - x^*\|_2^2 \leq \frac{2}{\mu}\left(f(x_{k+1}) - f(x^*)\right) \tag{5} ∥xk+1−x∗∥22≤μ2(f(xk+1)−f(x∗))(5)(由式(1)变形:两边同乘2/μ2/\mu2/μ,不等号方向不变)
-
对xkx_kxk:
f(xk)−f(x∗)≥μ2∥xk−x∗∥22 ⟹ 2μ(f(xk)−f(x∗))≥∥xk−x∗∥22(6) f(x_k) - f(x^*) \geq \frac{\mu}{2}\|x_k - x^*\|_2^2 \implies \frac{2}{\mu}\left(f(x_k) - f(x^*)\right) \geq \|x_k - x^*\|_2^2 \tag{6} f(xk)−f(x∗)≥2μ∥xk−x∗∥22⟹μ2(f(xk)−f(x∗))≥∥xk−x∗∥22(6)
四、步骤3:合并推导得到迭代误差界
将式(4)(函数值差衰减)代入式(5),再结合式(6)(函数值差与xkx_kxk误差的关联):
∥xk+1−x∗∥22≤2μ⋅(1−μL)(f(xk)−f(x∗)) \|x_{k+1} - x^*\|_2^2 \leq \frac{2}{\mu} \cdot \left(1 - \frac{\mu}{L}\right)\left(f(x_k) - f(x^*)\right) ∥xk+1−x∗∥22≤μ2⋅(1−Lμ)(f(xk)−f(x∗))
由式(6)可知2μ(f(xk)−f(x∗))≥∥xk−x∗∥22\frac{2}{\mu}\left(f(x_k) - f(x^*)\right) \geq \|x_k - x^*\|_2^2μ2(f(xk)−f(x∗))≥∥xk−x∗∥22,因此:
∥xk+1−x∗∥22≤(1−μL)⋅2μ(f(xk)−f(x∗))≤(1−μL)∥xk−x∗∥22 \|x_{k+1} - x^*\|_2^2 \leq \left(1 - \frac{\mu}{L}\right) \cdot \frac{2}{\mu}\left(f(x_k) - f(x^*)\right) \leq \left(1 - \frac{\mu}{L}\right)\|x_k - x^*\|_2^2 ∥xk+1−x∗∥22≤(1−Lμ)⋅μ2(f(xk)−f(x∗))≤(1−Lμ)∥xk−x∗∥22五、结论
最终证得迭代误差界公式:
∥xk+1−x∗∥22≤(1−μL)∥xk−x∗∥22 \boxed{\| x_{k+1}-x^{*}\| _{2}^{2} \leq\left(1-\frac{\mu}{L}\right)\left\| x_{k}-x^{*}\right\| _{2}^{2}} ∥xk+1−x∗∥22≤(1−Lμ)∥xk−x∗∥22
该公式表明:强凸+L-光滑条件下,梯度下降的迭代误差按(1−μ/L)(1 - \mu/L)(1−μ/L)的线性因子衰减,收敛速度由条件数κ=L/μ\kappa=L/\muκ=L/μ决定——κ\kappaκ越大,(1−1/κ)(1 - 1/\kappa)(1−1/κ)越接近1,误差衰减越慢,且易因等高线“细长”出现“楼梯形”迂回路径。 -
-
关键影响因子:条件数κ\kappaκ
定义条件数κ=L/μ\kappa = L/\muκ=L/μ(L与μ的比值),线性收敛的“衰减速度”由κ\kappaκ决定:- κ\kappaκ越小(L与μ接近):衰减因子(1−1/κ)(1 - 1/\kappa)(1−1/κ)越接近0,收敛越快;
- κ\kappaκ越大(L远大于μ):衰减因子越接近1,收敛越慢,且极易出现“楼梯现象”。
2. PL(Polyak–Lojasiewicz)不等式:宽松条件下的线性型收敛
-
PL条件定义:若存在常数μ>0\mu > 0μ>0,对任意迭代点xxx,函数值差与梯度范数满足以下关系:
f(x)−f(x∗)≤12μ∥∇f(x)∥22 f(x) - f(x^*) \leq \frac{1}{2\mu} \|\nabla f(x)\|_2^2 f(x)−f(x∗)≤2μ1∥∇f(x)∥22
(f(x∗)f(x^*)f(x∗)为函数最小值,PL条件是强凸性的“弱化版本”——无需函数严格强凸,仅通过“函数值差距”与“梯度大小”的关联约束函数形态)。 -
收敛结果:即使f(x)f(x)f(x)非强凸,只要满足PL条件,梯度下降仍能实现线性型收敛,函数值差的衰减公式为:
f(xk)−f(x∗)≤(1−μL)k[f(x0)−f(x∗)] f(x_k) - f(x^*) \leq \left(1 - \frac{\mu}{L}\right)^k \left[f(x_0) - f(x^*)\right] f(xk)−f(x∗)≤(1−Lμ)k[f(x0)−f(x∗)]
(x0x_0x0为初始迭代点,kkk为迭代次数)。(上文已经证明这个不等式) -
实际意义:解释了深度学习训练中的常见现象——深度网络的损失函数通常非强凸,但可能满足PL条件,因此训练时损失曲线会呈现“近似线性下降”的稳定趋势。
3. “楼梯现象”:成因与缓解
-
现象描述:当函数条件数κ=L/μ\kappa = L/\muκ=L/μ过大时,负梯度下降的迭代路径会呈现“楼梯形”(如图标注“条件数大 ⇒ 楼梯路径”):沿细长的等高线(如二次函数的椭圆等高线)迂回前进,每次仅沿等高线短轴方向小幅下降,无法直接逼近最小值点,迭代效率极低。
-
核心成因:条件数κ\kappaκ过大导致函数等高线“细长扁平”,负梯度方向(沿等高线法向)与“最优下降方向”(沿等高线长轴方向)偏差极大,梯度下降陷入“来回震荡、缓慢逼近”的困境。
-
缓解方法:预条件化(或输入/参数归一化)——通过线性变换(如文档中二次函数的坐标变换y=A1/2xy = A^{1/2}xy=A1/2x)将“细长谷”地形转化为“圆形洼地”,本质是减小条件数κ\kappaκ,使负梯度方向更接近最优下降方向,从而消除楼梯现象。
实践提示
- 预条件化的核心价值:通过调整优化空间的度量规则(如引入预条件矩阵),显著降低条件数κ\kappaκ,从根本上改善收敛速度;
- 迭代停止准则:无需迭代至完全收敛,满足以下任一条件即可终止:
- 梯度范数足够小(函数接近平稳):∥∇f(xk)∥2≤ε\|\nabla f(x_k)\|_2 \leq \varepsilon∥∇f(xk)∥2≤ε(ε\varepsilonε为预设精度,如10−610^{-6}10−6);
- 函数值相对下降不足(继续迭代收益极低):f(xk−1)−f(xk)max(1,f(xk−1))≤ε\frac{f(x_{k-1}) - f(x_k)}{\max(1, f(x_{k-1}))} \leq \varepsilonmax(1,f(xk−1))f(xk−1)−f(xk)≤ε。
五、Newton法:局部二次近似与两阶段收敛
Newton法是比梯度下降更高效的优化方法,核心是通过函数的局部二次近似确定搜索方向,兼具“局部快速收敛”与“全局有效下降”的特性,其核心逻辑围绕“二阶展开→牛顿步→收敛性”展开:
1. 核心思路:函数的局部二次近似
梯度下降仅用“一阶信息(梯度)”将函数局部近似为线性函数,而Newton法引入“二阶信息(Hessian矩阵)”,将函数局部近似为二次函数(更贴合非凸函数的局部曲率),具体如下:
对迭代点xxx,将目标函数f(x+Δ)f(x+\Delta)f(x+Δ)在xxx处做二阶泰勒展开(Δ\DeltaΔ为搜索方向向量):
f(x+Δ)≈f(x)+∇f(x)⊤Δ+12Δ⊤H(x)Δ
f(x+\Delta) \approx f(x) + \nabla f(x)^\top \Delta + \frac{1}{2}\Delta^\top H(x) \Delta
f(x+Δ)≈f(x)+∇f(x)⊤Δ+21Δ⊤H(x)Δ
其中:
- ∇f(x)\nabla f(x)∇f(x)是f(x)f(x)f(x)的梯度(一阶导数);
- H(x)=∇2f(x)H(x) = \nabla^2 f(x)H(x)=∇2f(x)是f(x)f(x)f(x)的Hessian矩阵(二阶导数矩阵),反映函数在xxx处的局部曲率。
Newton法的核心是:最小化上述二次近似函数,直接求解使近似函数最小的搜索方向Δ\DeltaΔ。
2. 牛顿步(Newton Step)的推导
对二阶近似函数关于Δ\DeltaΔ求导,并令导数为0(二次函数的极值点条件):
∂∂Δ[f(x)+∇f(x)⊤Δ+12Δ⊤H(x)Δ]=∇f(x)+H(x)Δ=0
\frac{\partial}{\partial \Delta}\left[ f(x) + \nabla f(x)^\top \Delta + \frac{1}{2}\Delta^\top H(x) \Delta \right] = \nabla f(x) + H(x) \Delta = 0
∂Δ∂[f(x)+∇f(x)⊤Δ+21Δ⊤H(x)Δ]=∇f(x)+H(x)Δ=0
若Hessian矩阵正定(H(x)≻0H(x) \succ 0H(x)≻0,保证二次近似函数是凸函数,极值点为最小值点),则可解出唯一的搜索方向——牛顿步:
Δnt=−H(x)−1∇f(x)
\Delta_{nt} = -H(x)^{-1} \nabla f(x)
Δnt=−H(x)−1∇f(x)
3. 牛顿步的下降性
牛顿步能保证是“下降方向”的前提是H(x)≻0H(x) \succ 0H(x)≻0,证明如下:
计算梯度与牛顿步的内积(判断方向是否下降的核心指标,内积<0则为下降方向):
∇f(x)⊤Δnt=∇f(x)⊤(−H(x)−1∇f(x))
\nabla f(x)^\top \Delta_{nt} = \nabla f(x)^\top \left( -H(x)^{-1} \nabla f(x) \right)
∇f(x)⊤Δnt=∇f(x)⊤(−H(x)−1∇f(x))
因H(x)≻0H(x) \succ 0H(x)≻0,其逆矩阵H(x)−1H(x)^{-1}H(x)−1也正定,故对任意非零向量∇f(x)\nabla f(x)∇f(x),有∇f(x)⊤H(x)−1∇f(x)>0\nabla f(x)^\top H(x)^{-1} \nabla f(x) > 0∇f(x)⊤H(x)−1∇f(x)>0,因此:
∇f(x)⊤Δnt<0
\nabla f(x)^\top \Delta_{nt} < 0
∇f(x)⊤Δnt<0
即牛顿步满足“下降方向”的核心条件。
4. 局部二次收敛:牛顿法的核心优势
当迭代点足够靠近最优解x∗x^*x∗时,Newton法会呈现二次收敛(收敛速度远快于梯度下降的线性收敛),严格定义如下:
收敛条件
若满足以下两个前提:
- Hessian矩阵H(x)H(x)H(x)在x∗x^*x∗的邻域内Lipschitz连续(曲率变化平缓);
- 初始迭代点x(0)x^{(0)}x(0)足够靠近x∗x^*x∗(进入“局部收敛域”)。
二次收敛公式
此时存在常数C>0C > 0C>0,使得迭代误差满足:
∥xk+1−x∗∥≤C⋅∥xk−x∗∥2
\| x_{k+1} - x^* \| \leq C \cdot \| x_k - x^* \|^2
∥xk+1−x∗∥≤C⋅∥xk−x∗∥2
结论:
在HHH在某邻域内满足 Lipschitz(存在常数MMM使得∣H(x)−H(y)∣≤M∣x−y∣|H(x)-H(y)| \le M|x-y|∣H(x)−H(y)∣≤M∣x−y∣)且H(x∗)H(x^*)H(x∗)非奇异的情形,从足够近的初值出发,牛顿迭代局部二次收敛,即存在常数C>0C>0C>0和半径r>0r>0r>0,当∣xk−x∗∣≤r|x_k-x^*| \le r∣xk−x∗∣≤r时
∣xk+1−x∗∣≤C∣xk−x∗∣2. |x_{k+1}-x^*| \le C|x_k-x^*|^2. ∣xk+1−x∗∣≤C∣xk−x∗∣2.
证明(简洁严谨):设误差ek:=xk−x∗e_k := x_k - x^*ek:=xk−x∗。由∇f(x∗)=0\nabla f(x^*) = 0∇f(x∗)=0和一维积分形式的泰勒公式:
∇f(xk)=∫01H(x∗+tek)ek dt. \nabla f(x_k) = \int_0^1 H(x^* + t e_k) e_k \, dt. ∇f(xk)=∫01H(x∗+tek)ekdt.
牛顿更新写作:
ek+1=xk−x∗−H(xk)−1∇f(xk)=H(xk)−1(H(xk)−∫01H(x∗+tek)dt)ek. e_{k+1} = x_k - x^* - H(x_k)^{-1} \nabla f(x_k) = H(x_k)^{-1} \left( H(x_k) - \int_0^1 H(x^* + t e_k) dt \right) e_k. ek+1=xk−x∗−H(xk)−1∇f(xk)=H(xk)−1(H(xk)−∫01H(x∗+tek)dt)ek.
取范数并用三角不等式得:
∣ek+1∣≤∣H(xk)−1∣∫01∣H(xk)−H(x∗+tek)∣dt⋅∣ek∣. |e_{k+1}| \le |H(x_k)^{-1}| \int_0^1 |H(x_k) - H(x^* + t e_k)| dt \cdot |e_k|. ∣ek+1∣≤∣H(xk)−1∣∫01∣H(xk)−H(x∗+tek)∣dt⋅∣ek∣.
利用 Hessian 的 Lipschitz 性质(常数记为MMM):
∣H(xk)−H(x∗+tek)∣≤M∣xk−(x∗+tek)∣=M(1−t)∣ek∣. |H(x_k) - H(x^* + t e_k)| \le M |x_k - (x^* + t e_k)| = M(1 - t)|e_k|. ∣H(xk)−H(x∗+tek)∣≤M∣xk−(x∗+tek)∣=M(1−t)∣ek∣.
代入并对ttt积分:
∣ek+1∣≤∣H(xk)−1∣⋅M(∫01(1−t)dt)∣ek∣2=M2∣H(xk)−1∣∣ek∣2. |e_{k+1}| \le |H(x_k)^{-1}| \cdot M \left( \int_0^1 (1 - t) dt \right) |e_k|^2 = \frac{M}{2} |H(x_k)^{-1}| |e_k|^2. ∣ek+1∣≤∣H(xk)−1∣⋅M(∫01(1−t)dt)∣ek∣2=2M∣H(xk)−1∣∣ek∣2.
由于HHH连续且H(x∗)H(x^*)H(x∗)非奇异,存在半径r>0r>0r>0,使得对所有∣x−x∗∣≤r|x - x^*| \le r∣x−x∗∣≤r,H(x)H(x)H(x)可逆,且∣H(x)−1∣≤B|H(x)^{-1}| \le B∣H(x)−1∣≤B(BBB为该闭球上逆的上界)。因此当∣ek∣≤r|e_k| \le r∣ek∣≤r时:
∣ek+1∣≤MB2∣ek∣2. |e_{k+1}| \le \frac{M B}{2} |e_k|^2. ∣ek+1∣≤2MB∣ek∣2.
令常数C:=MB2C := \frac{M B}{2}C:=2MB,即得局部二次收敛估计。
直观意义
二次收敛意味着“每次迭代后,误差的有效位数会翻倍”——例如:若第kkk步误差为10−210^{-2}10−2,第k+1k+1k+1步误差可降至10−410^{-4}10−4,第k+2k+2k+2步可降至10−810^{-8}10−8,接近最优解时收敛极快。

6932

被折叠的 条评论
为什么被折叠?



