凸优化4:无约束优化问题

无约束优化问题

一、无约束优化问题

1. 问题基本形式

针对凸且二阶可微的目标函数,无约束优化问题的数学形式定义为:
min⁡f(x) \min f(x) minf(x)
其中,f(x)f(x)f(x)满足“凸性”与“二阶可微性”这两个核心前提假设、。

2. 最优性条件

无约束优化问题达到最优解x∗x^*x的核心必要条件为:
∇f(x∗)=0 \nabla f(x^*) = 0 f(x)=0
即最优解处函数的梯度(一阶导数)等于零向量;若该等式无法直接求解,则需通过迭代方法逼近最优解、。

3. 核心求解框架(下山法迭代格式)

下山法通过迭代构造严格递减的函数值序列以逼近最优解,其数学化迭代流程如下:

  1. 初始设定:给定初始迭代点x(0)x^{(0)}x(0),初始化迭代次数k=0k=0k=0
  2. 方向选取:确定第kkk次迭代的搜索方向Δx(k)\Delta x^{(k)}Δx(k)(后续需进一步优化方向选取规则);
  3. 步长选取:确定第kkk次迭代的步长α>0\alpha > 0α>0(后续需进一步优化步长选取规则);
  4. 迭代更新:按以下公式更新迭代点:

x(k+1)=x(k)+αΔx(k) x^{(k+1)} = x^{(k)} + \alpha \Delta x^{(k)} x(k+1)=x(k)+αΔx(k)

同时更新迭代次数k←k+1k \leftarrow k+1kk+1,且需满足函数值严格递减条件:
f(x(0))>f(x(1))>f(x(2))>… f(x^{(0)}) > f(x^{(1)}) > f(x^{(2)}) > \dots f(x(0))>f(x(1))>f(x(2))>

综上,无约束优化问题的核心数学转化目标为:通过数学规则确定“搜索方向Δx(k)\Delta x^{(k)}Δx(k)”与“步长α\alphaα”,使上述迭代流程满足严格递减性并收敛至最优解。

二、搜索方向的确定

视角1:线性化与下降条件

  • 梯度L-Lipschitz条件:若函数fff的梯度满足L-Lipschitz连续性,等价于:
    ∥∇f(x)−∇f(y)∥2≤L∥x−y∥2 \| \nabla f(x)-\nabla f(y)\| _{2} \leq L\| x-y\| _{2} ∥∇f(x)f(y)2Lxy2
    其中LLL为Lipschitz常数,∥⋅∥2\|\cdot\|_22表示欧氏范数。

  • 函数线性化不等式:利用基本定理与Cauchy–Schwarz公式,可推导出函数在点xxx处的线性化上界:
    f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22 f(x+\Delta) \leq f(x)+\nabla f(x)^{\top} \Delta+\frac{L}{2}\| \Delta\| _{2}^{2} f(x+Δ)f(x)+f(x)Δ+2L∥Δ22

推导不等式f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22f(x+\Delta) \leq f(x)+\nabla f(x)^{\top} \Delta+\frac{L}{2}\| \Delta\| _{2}^{2}f(x+Δ)f(x)+f(x)Δ+2L∥Δ22

梯度L-Lipschitz连续性

(推导的基础,保证梯度变化有界)
∥∇f(x)−∇f(x+tΔ)∥2≤L⋅∥tΔ∥2=Lt∥Δ∥2(t∈[0,1]) \|\nabla f(x) - \nabla f(x + t\Delta)\|_2 \leq L \cdot \|t\Delta\|_2 = L t \|\Delta\|_2 \quad (t \in [0,1]) ∥∇f(x)f(x+tΔ)2LtΔ2=Lt∥Δ2(t[0,1])

多元微积分基本定理

f(x+Δ)−f(x)=∫01∇f(x+tΔ)⊤Δ dt f(x+\Delta) - f(x) = \int_{0}^{1} \nabla f\left(x + t\Delta\right)^{\top} \Delta \, dt f(x+Δ)f(x)=01f(x+tΔ)Δdt

积分拆分与线性项提取

∫01∇f(x+tΔ)⊤Δdt=∇f(x)⊤Δ⋅∫01dt+∫01[∇f(x+tΔ)−∇f(x)]⊤Δdt \int_{0}^{1} \nabla f(x + t\Delta)^{\top}\Delta dt = \nabla f(x)^{\top}\Delta \cdot \int_{0}^{1} dt + \int_{0}^{1} \left[\nabla f(x + t\Delta) - \nabla f(x)\right]^{\top}\Delta dt 01f(x+tΔ)Δdt=f(x)Δ01dt+01[f(x+tΔ)f(x)]Δdt

其中第一部分积分结果直接为线性项:
∇f(x)⊤Δ⋅∫01dt=∇f(x)⊤Δ \nabla f(x)^{\top}\Delta \cdot \int_{0}^{1} dt = \nabla f(x)^{\top}\Delta f(x)Δ01dt=f(x)Δ

Cauchy-Schwarz不等式+L-Lipschitz条件

(控制第二部分积分,得到“二次项L2∥Δ∥22\frac{L}{2}\|\Delta\|_2^22L∥Δ22”)

  • 由Cauchy-Schwarz不等式:[∇f(x+tΔ)−∇f(x)]⊤Δ≤∥∇f(x+tΔ)−∇f(x)∥2⋅∥Δ∥2\left[\nabla f(x + t\Delta) - \nabla f(x)\right]^{\top}\Delta \leq \|\nabla f(x + t\Delta) - \nabla f(x)\|_2 \cdot \|\Delta\|_2[f(x+tΔ)f(x)]Δ∥∇f(x+tΔ)f(x)2∥Δ2
  • 代入L-Lipschitz条件并积分:

∫01∥∇f(x+tΔ)−∇f(x)∥2⋅∥Δ∥2dt≤∫01Lt∥Δ∥22dt=L2∥Δ∥22 \int_{0}^{1} \|\nabla f(x + t\Delta) - \nabla f(x)\|_2 \cdot \|\Delta\|_2 dt \leq \int_{0}^{1} L t \|\Delta\|_2^2 dt = \frac{L}{2}\|\Delta\|_2^2 01∥∇f(x+tΔ)f(x)2∥Δ2dt01Lt∥Δ22dt=2L∥Δ22

合并得到最终不等式

f(x+Δ)−f(x)≤∇f(x)⊤Δ+L2∥Δ∥22  ⟹  f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22 f(x+\Delta) - f(x) \leq \nabla f(x)^{\top}\Delta + \frac{L}{2}\|\Delta\|_2^2 \implies f(x+\Delta) \leq f(x) + \nabla f(x)^{\top}\Delta + \frac{L}{2}\|\Delta\|_2^2 f(x+Δ)f(x)f(x)Δ+2L∥Δ22f(x+Δ)f(x)+f(x)Δ+2L∥Δ22

  • 下降方向核心结论:令Δ=αp\Delta=\alpha pΔ=αpα>0\alpha>0α>0为步长,ppp为搜索方向),只要满足特定条件,就存在足够小的α>0\alpha>0α>0使函数值降低——这是下降方向的充要条件。其中,最自然的搜索方向选择为负梯度方向
    pgd=−∇f(x) p_{gd}=-\nabla f(x) pgd=f(x)

视角2:一般范数下的“最速下降”

  • 范数与对偶范数:对任意范数∥⋅∥\|\cdot\|及其对应的对偶范数∥⋅∥∗\|\cdot\|_*,“最速下降方向”需通过求解以下优化问题得到:
    p∗=arg⁡min⁡∥d∥∗≤1∇f(x)⊤d p^{*}=\arg \min _{\| d\| _{*} \leq 1} \nabla f(x)^{\top} d p=argd1minf(x)d

  • 最优方向解:上述优化问题的解为:
    p∗=−∇f(x)∥∇f(x)∥ p^{*}=-\frac{\nabla f(x)}{\| \nabla f(x)\| } p=∥∇f(x)f(x)

  • 特殊范数案例

    • 当使用欧氏范数时,对偶范数与原范数一致,此时p∗p^*p即为负梯度方向(与前文中结论一致);
    • 若使用Hessian度量(定义为∥d∥H(x)=d⊤H(x)d\|d\|_{H(x)}=\sqrt{d^{\top} H(x) d}dH(x)=dH(x)dH(x)H(x)H(x)为函数fffxxx处的Hessian矩阵),则“最速”方向等价于Newton步(详见后续Newton法相关内容)。

    函数fff在点xxx沿方向ddd局部下降速度,由梯度与方向的内积∇f(x)⊤d\nabla f(x)^\top df(x)d决定:

    • 内积越小(越负),函数沿ddd下降越快;

    • 因此“找最速下降方向”,等价于在约束∥d∥∗≤1\|d\|_* \leq 1d1(对偶范数单位球)下,求解:
      p∗=arg⁡min⁡∥d∥∗≤1∇f(x)⊤d p^* = \arg\min_{\|d\|_* \leq 1} \nabla f(x)^\top d p=argd1minf(x)d

    a=∇f(x)a = \nabla f(x)a=f(x),需先确定a⊤da^\top dad(即∇f(x)⊤d\nabla f(x)^\top df(x)d)的最小可能值。
    根据对偶范数的核心性质:对任意满足∥d∥∗≤1\|d\|_* \leq 1d1ddd,有:
    a⊤d≥−∥a∥ a^\top d \geq -\|a\| ada
    方向p∗=−∇f(x)∥∇f(x)∥p^* = -\frac{\nabla f(x)}{\|\nabla f(x)\|}p=∥∇f(x)f(x),既满足对偶范数单位球约束,又能让内积达到最小(下降最快),因此它就是单位球上的最速下降方向。

3. 预条件化的作用

最速下降方向是 “当前范数下,使内积∇f(x)⊤d\nabla f(x)^\top df(x)d最小(下降最快)的方向”。预条件化的本质是改变 “范数度量标准”:不再用欧氏范数,而是用 “预条件范数”

  • 二次函数场景:考虑二次目标函数
    f(x)=12x⊤Ax−b⊤x(A≻0) f(x)=\frac{1}{2} x^{\top} A x-b^{\top} x \quad (A \succ 0) f(x)=21xAxbx(A0)
    其等高线为椭圆(AAA为正定矩阵,决定椭圆的形状与方向)。

  • 预条件化核心操作:通过坐标变换y=A1/2xy=A^{1/2} xy=A1/2x,可将原椭圆等高线“拉成”圆形(即消除椭圆的“细长”特性),这一过程称为预条件化

  • 直观意义:预条件化相当于将优化问题中的“细长谷”地形转化为“圆形洼地”,从而缓解负梯度下降时容易出现的“楼梯形”迂回路径,提升迭代效率。

三、如何确定步长

设线搜索的核心目标函数为ϕ(α)=f(x+αp)\phi(\alpha) = f(x + \alpha p)ϕ(α)=f(x+αp),其中xxx为当前迭代点,ppp为已确定的搜索方向,α≥0\alpha \geq 0α0为待求解的步长(需满足函数值下降条件f(x+αp)<f(x)f(x + \alpha p) < f(x)f(x+αp)<f(x))。以下分别介绍三种主流线搜索方法:

1. 精确线搜索(Exact Line Search)

1.1 核心定义

精确线搜索直接求解“使ϕ(α)\phi(\alpha)ϕ(α)最小化”的步长α∗\alpha^*α,数学表达为:
α∗=arg⁡min⁡α≥0ϕ(α) \alpha^{*} = \arg \min _{\alpha \geq 0} \phi(\alpha) α=argα0minϕ(α)
其目标是找到“当前方向下最优的步长”,理论上能让单次迭代的函数值下降幅度最大。

1.2 二次函数的封闭解

若目标函数为二次函数f(x)=12x⊤Ax−b⊤xf(x) = \frac{1}{2} x^\top A x - b^\top xf(x)=21xAxbx(其中A≻0A \succ 0A0,即AAA为正定矩阵),且搜索方向p=−∇f(x)=−gp = -\nabla f(x) = -gp=f(x)=gg=∇f(x)g = \nabla f(x)g=f(x)为当前梯度),则精确线搜索的步长有封闭解
α∗=g⊤gg⊤Ag \alpha^{*} = \frac{g^\top g}{g^\top A g} α=gAggg
该解的本质是:在二次函数的近似下,使“更新后的梯度∇f(x+αp)\nabla f(x + \alpha p)f(x+αp)与搜索方向ppp垂直”(即一次更新在二次近似意义上最有效),等价于求解arg⁡min⁡α∥g−αAg∥22\arg \min _{\alpha} \|g - \alpha A g\|_2^2argminαgαAg22

1.3 与固定步长的比较

在函数满足 L-光滑性(梯度L-Lipschitz连续)的前提下,精确线搜索得到的α∗\alpha^*α至少不劣于固定步长α=1/L\alpha = 1/Lα=1/L(固定步长仅能保证“函数值下降”,但无法保证下降幅度最优)。

2. 黄金分割(Golden Section Search)

2.1 适用场景

当目标函数ϕ(α)\phi(\alpha)ϕ(α)单峰函数(即区间内仅有一个最小值点),且计算梯度(或导数ϕ′(α)\phi'(\alpha)ϕ(α))代价高、难度大时,采用黄金分割法通过“区间收缩”逼近最优步长α∗\alpha^*α

2.2 核心流程
  1. 初始区间设定:确定初始搜索区间[a,b][a, b][a,b],满足ϕ(0)<ϕ(b)\phi(0) < \phi(b)ϕ(0)<ϕ(b)(保证最小值点在区间内,因α=0\alpha=0α=0对应当前点,函数值最大),初始令a=0a=0a=0

  2. 区间收缩规则

    • 在区间[a,b][a, b][a,b]内选取两个对称点t1t_1t1t2t_2t2a<t1<t2<ba < t_1 < t_2 < ba<t1<t2<b),两点间距与区间总长的比例为“黄金分割系数”c=12(5−1)≈0.618c = \frac{1}{2}(\sqrt{5} - 1) \approx 0.618c=21(51)0.618,即:
      t1=a+(1−c)(b−a),t2=a+c(b−a) t_1 = a + (1 - c)(b - a), \quad t_2 = a + c(b - a) t1=a+(1c)(ba),t2=a+c(ba)

    • 比较函数值:

      • ϕ(t2)>ϕ(t1)\phi(t_2) > \phi(t_1)ϕ(t2)>ϕ(t1):说明最小值点α∗∈[a,t2]\alpha^* \in [a, t_2]α[a,t2],令新区间为[a,t2][a, t_2][a,t2]
      • ϕ(t1)>ϕ(t2)\phi(t_1) > \phi(t_2)ϕ(t1)>ϕ(t2):说明最小值点α∗∈[t1,b]\alpha^* \in [t_1, b]α[t1,b],令新区间为[t1,b][t_1, b][t1,b]
  3. 迭代收敛:重复步骤2,不断收缩区间,直到区间长度小于预设精度。最终区间内的任意点均可作为α∗\alpha^*α的近似值,收敛误差上界与0.618k0.618^k0.618k成正比(kkk为迭代次数)。

2.3 特点

优点:无需计算梯度/导数,仅通过函数值比较即可迭代;
缺点:收敛速度较慢(线性收敛),仅适用于单峰函数。

3. 回溯搜索(Backtracking Line Search)与 Armijo–Wolfe 准则

3.1 核心准则(Armijo + Wolfe)

回溯搜索通过“先试后调”的方式确定步长,需满足两个核心条件(保证步长既“足够大”以加速收敛,又“足够小”以保证函数值下降):

  1. Armijo 条件(充分下降条件):确保步长能使函数值显著下降,数学表达为:
    f(x+αp)≤f(x)+c1α∇f(x)⊤p f(x + \alpha p) \leq f(x) + c_1 \alpha \nabla f(x)^\top p f(x+αp)f(x)+c1αf(x)p
    其中0<c1<10 < c_1 < 10<c1<1(通常取c1=10−4c_1 = 10^{-4}c1=104),∇f(x)⊤p<0\nabla f(x)^\top p < 0f(x)p<0(因ppp为下降方向),右边项为函数值的“预期下降下限”。

  2. Wolfe 条件(曲率条件):确保步长不会过小(避免收敛过慢),数学表达为:
    ∇f(x+αp)⊤p≥c2∇f(x)⊤p \nabla f(x + \alpha p)^\top p \geq c_2 \nabla f(x)^\top p f(x+αp)pc2f(x)p
    其中c1<c2<1c_1 < c_2 < 1c1<c2<1(通常取c2=0.9c_2 = 0.9c2=0.9),该条件要求“更新后的梯度与搜索方向的内积”不小于“初始梯度与搜索方向内积”的c2c_2c2倍,避免步长停留在“函数值下降缓慢的区域”。

3.2 回溯搜索算法流程

给定后退因子β∈(0,1)\beta \in (0, 1)β(0,1)(通常取β=0.5\beta = 0.5β=0.50.80.80.8),步骤如下:

  1. 初始步长尝试:令初始步长α←1\alpha \leftarrow 1α1(默认从“单位步长”开始,适配 Newton 法等需要大步长的场景);
  2. 条件判断与步长调整:若当前α\alphaα不满足 Armijo 条件( Armijo–Wolfe 联合条件),则按比例缩小步长:α←βα\alpha \leftarrow \beta \alphaαβα
  3. 终止:重复步骤2,直到α\alphaα满足预设条件,输出最终步长α\alphaα
3.3 关键性质与应用
  1. 终止性:由 Descent Lemma(f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22f(x+\Delta) \leq f(x) + \nabla f(x)^\top \Delta + \frac{L}{2}\|\Delta\|_2^2f(x+Δ)f(x)+f(x)Δ+2L∥Δ22)可证明:当α\alphaα足够小时,Armijo 条件必成立,因此回溯搜索一定能终止;
  2. 与 Newton 法的结合(两阶段收敛)
    • 阶段 I(远离最优解时):α<1\alpha < 1α<1,通过回溯调整步长进入“可接受域”(满足 Armijo–Wolfe 条件);
    • 阶段 II(靠近最优解时):步长会触发α=1\alpha = 1α=1(单位步长),此时 Newton 法可实现二次收敛(收敛速度远快于梯度下降)。

四、收敛率:强凸 / PL 条件与“楼梯现象”

1. 强凸 + L-光滑:线性收敛

  • 核心前提:目标函数f(x)f(x)f(x)需同时满足两大性质:

    1. 强凸性:存在常数μ>0\mu > 0μ>0,对任意迭代点xxx,其Hessian矩阵(二阶导数矩阵)满足下界约束:
      μI⪯∇2f(x) \mu I \preceq \nabla^2 f(x) μI2f(x)
      (“强凸”保证函数有唯一最小值点,且函数形态“下凸程度”可控);

    2. L-光滑性:存在常数L>0L > 0L>0,对任意迭代点xxx,其Hessian矩阵满足上界约束:
      ∇2f(x)⪯LI \nabla^2 f(x) \preceq L I 2f(x)LI
      (“L-光滑”保证函数曲率不超过阈值,梯度变化平缓,避免局部剧烈波动)。

  • 收敛公式:当步长取α=1/L\alpha = 1/Lα=1/L时,梯度下降迭代满足严格的线性收敛性质:

    1. 函数值下降界(每次迭代函数值必递减且幅度可控):
      f(xk+1)≤f(xk)−12L∥∇f(xk)∥22 f(x_{k+1}) \leq f(x_k) - \frac{1}{2L} \|\nabla f(x_k)\|_2^2 f(xk+1)f(xk)2L1∥∇f(xk)22

      根据这个公式进行推导即可:f(x+Δ)≤f(x)+∇f(x)⊤Δ+L2∥Δ∥22f(x+\Delta) \leq f(x) + \nabla f(x)^{\top}\Delta + \frac{L}{2}\|\Delta\|_2^2f(x+Δ)f(x)+f(x)Δ+2L∥Δ22

      其中Δ=αp\Delta = \alpha pΔ=αp,p=−∇f(x)p=-\nabla f(x)p=f(x)为下降方向

    2. 迭代点误差界(x∗x^*x为函数最优解,与最优解的距离按固定比例缩小):
      ∥xk+1−x∗∥22≤(1−μL)∥xk−x∗∥22 \|x_{k+1} - x^*\|_2^2 \leq \left(1 - \frac{\mu}{L}\right) \|x_k - x^*\|_2^2 xk+1x22(1Lμ)xkx22

    要证明该迭代误差界,需以函数的强凸性L-光滑性及已证的函数值下降界为核心依据,通过“迭代误差与函数值差的关联”逐步推导,具体步骤如下:

    一、明确核心前提与已有结论

    在证明前,需明确2个关键性质(强凸+L-光滑)的推论,及1个已证结论:

    1. 强凸性的核心推论
      若函数fff强凸(存在μ>0\mu>0μ>0,使μI⪯∇2f(x)\mu I \preceq \nabla^2 f(x)μI2f(x)),则对任意迭代点xxx与最优解x∗x^*x(满足∇f(x∗)=0\nabla f(x^*)=0f(x)=0),有:
      f(x)−f(x∗)≥μ2∥x−x∗∥22(1) f(x) - f(x^*) \geq \frac{\mu}{2}\|x - x^*\|_2^2 \tag{1} f(x)f(x)2μxx22(1)
      (强凸性保证“函数值与最优值的差距”不小于“迭代点与最优解距离平方”的固定倍数,建立误差与函数值差的关联)

      同时,强凸性还可推出“梯度范数与函数值差的关系”:

      因为∇f(x∗)=0\nabla f(x^*)=0f(x)=0
      f(x∗)≥f(x)+∇f(x)⊤(x∗−x)+μ2∣x∗−x∣2. f(x^*)\ge f(x)+\nabla f(x)^{\top}(x^*-x)+\frac{\mu}{2}|x^*-x|^2. f(x)f(x)+f(x)(xx)+2μxx2.
      移项:
      f(x)−f(x∗)≤∇f(x)⊤(x−x∗)−μ2∣x−x∗∣2.(B) f(x)-f(x^*)\le\nabla f(x)^{\top}(x-x^*)-\frac{\mu}{2}|x-x^*|^2. \tag{B} f(x)f(x)f(x)(xx)2μxx2.(B)
      由 Cauchy–Schwarz:
      ∇f(x)⊤(x−x∗)≤∣∇f(x)∣⋅∣x−x∗∣.\nabla f(x)^{\top}(x-x^*) \le |\nabla f(x)|\cdot|x-x^*|.f(x)(xx)∣∇f(x)xx∣.
      令右侧关于∣x−x∗∣|x-x^*|xx的表达最小化,可视为二次函数
      ∣∇f(x)∣⋅∣x−x∗∣−μ2∣x−x∗∣2. |\nabla f(x)|\cdot|x-x^*|-\frac{\mu}{2}|x-x^*|^2. ∣∇f(x)xx2μxx2.
      其最大值出现在∣x−x∗∣=∣∇f(x)∣μ|x-x^*|=\frac{|\nabla f(x)|}{\mu}xx=μ∣∇f(x),代入得
      f(x)−f(x∗)≤12μ∣∇f(x)∣2. f(x)-f(x^*)\le \frac{1}{2\mu}|\nabla f(x)|^2. f(x)f(x)2μ1∣∇f(x)2.

      ∥∇f(x)∥22≥2μ(f(x)−f(x∗))(2) \|\nabla f(x)\|_2^2 \geq 2\mu(f(x) - f(x^*)) \tag{2} ∥∇f(x)222μ(f(x)f(x))(2)

      (梯度大小能反映函数值与最优值的差距,为后续替换梯度项做准备)

    2. 已证的函数值下降界
      由L-光滑性(梯度L-Lipschitz连续)及步长α=1/L\alpha=1/Lα=1/L,已证明函数值满足:
      f(xk+1)≤f(xk)−12L∥∇f(xk)∥22(3) f(x_{k+1}) \leq f(x_k) - \frac{1}{2L}\|\nabla f(x_k)\|_2^2 \tag{3} f(xk+1)f(xk)2L1∥∇f(xk)22(3)

    二、步骤1:推导函数值差的线性衰减关系

    将式(3)变形为“相邻迭代的函数值差下界”:
    f(xk)−f(xk+1)≥12L∥∇f(xk)∥22 f(x_k) - f(x_{k+1}) \geq \frac{1}{2L}\|\nabla f(x_k)\|_2^2 f(xk)f(xk+1)2L1∥∇f(xk)22
    将强凸性推论式(2)(∥∇f(xk)∥22≥2μ(f(xk)−f(x∗))\|\nabla f(x_k)\|_2^2 \geq 2\mu(f(x_k) - f(x^*))∥∇f(xk)222μ(f(xk)f(x)))代入上式,替换梯度范数项:
    f(xk)−f(xk+1)≥12L⋅2μ(f(xk)−f(x∗)) f(x_k) - f(x_{k+1}) \geq \frac{1}{2L} \cdot 2\mu(f(x_k) - f(x^*)) f(xk)f(xk+1)2L12μ(f(xk)f(x))
    化简后得到“函数值差的衰减关系”:
    f(xk)−f(xk+1)≥μL(f(xk)−f(x∗)) f(x_k) - f(x_{k+1}) \geq \frac{\mu}{L}(f(x_k) - f(x^*)) f(xk)f(xk+1)Lμ(f(xk)f(x))
    进一步整理,将函数值差聚焦到“与最优值的差距”:
    f(xk+1)−f(x∗)≤f(xk)−f(x∗)−μL(f(xk)−f(x∗)) f(x_{k+1}) - f(x^*) \leq f(x_k) - f(x^*) - \frac{\mu}{L}(f(x_k) - f(x^*)) f(xk+1)f(x)f(xk)f(x)Lμ(f(xk)f(x))

    f(xk+1)−f(x∗)≤(1−μL)(f(xk)−f(x∗))(4) f(x_{k+1}) - f(x^*) \leq \left(1 - \frac{\mu}{L}\right)\left(f(x_k) - f(x^*)\right) \tag{4} f(xk+1)f(x)(1Lμ)(f(xk)f(x))(4)

    式(4)表明:迭代中“函数值与最优值的差距”按(1−μ/L)(1 - \mu/L)(1μ/L)的比例线性衰减。

    三、步骤2:将函数值差衰减转化为迭代误差衰减

    利用强凸性推论式(1),分别对xk+1x_{k+1}xk+1xkx_kxk建立“迭代误差与函数值差的关联”:

    • xk+1x_{k+1}xk+1
      ∥xk+1−x∗∥22≤2μ(f(xk+1)−f(x∗))(5) \|x_{k+1} - x^*\|_2^2 \leq \frac{2}{\mu}\left(f(x_{k+1}) - f(x^*)\right) \tag{5} xk+1x22μ2(f(xk+1)f(x))(5)

      (由式(1)变形:两边同乘2/μ2/\mu2/μ,不等号方向不变)

    • xkx_kxk
      f(xk)−f(x∗)≥μ2∥xk−x∗∥22  ⟹  2μ(f(xk)−f(x∗))≥∥xk−x∗∥22(6) f(x_k) - f(x^*) \geq \frac{\mu}{2}\|x_k - x^*\|_2^2 \implies \frac{2}{\mu}\left(f(x_k) - f(x^*)\right) \geq \|x_k - x^*\|_2^2 \tag{6} f(xk)f(x)2μxkx22μ2(f(xk)f(x))xkx22(6)

    四、步骤3:合并推导得到迭代误差界

    将式(4)(函数值差衰减)代入式(5),再结合式(6)(函数值差与xkx_kxk误差的关联):
    ∥xk+1−x∗∥22≤2μ⋅(1−μL)(f(xk)−f(x∗)) \|x_{k+1} - x^*\|_2^2 \leq \frac{2}{\mu} \cdot \left(1 - \frac{\mu}{L}\right)\left(f(x_k) - f(x^*)\right) xk+1x22μ2(1Lμ)(f(xk)f(x))
    由式(6)可知2μ(f(xk)−f(x∗))≥∥xk−x∗∥22\frac{2}{\mu}\left(f(x_k) - f(x^*)\right) \geq \|x_k - x^*\|_2^2μ2(f(xk)f(x))xkx22,因此:
    ∥xk+1−x∗∥22≤(1−μL)⋅2μ(f(xk)−f(x∗))≤(1−μL)∥xk−x∗∥22 \|x_{k+1} - x^*\|_2^2 \leq \left(1 - \frac{\mu}{L}\right) \cdot \frac{2}{\mu}\left(f(x_k) - f(x^*)\right) \leq \left(1 - \frac{\mu}{L}\right)\|x_k - x^*\|_2^2 xk+1x22(1Lμ)μ2(f(xk)f(x))(1Lμ)xkx22

    五、结论

    最终证得迭代误差界公式:
    ∥xk+1−x∗∥22≤(1−μL)∥xk−x∗∥22 \boxed{\| x_{k+1}-x^{*}\| _{2}^{2} \leq\left(1-\frac{\mu}{L}\right)\left\| x_{k}-x^{*}\right\| _{2}^{2}} xk+1x22(1Lμ)xkx22
    该公式表明:强凸+L-光滑条件下,梯度下降的迭代误差按(1−μ/L)(1 - \mu/L)(1μ/L)的线性因子衰减,收敛速度由条件数κ=L/μ\kappa=L/\muκ=L/μ决定——κ\kappaκ越大,(1−1/κ)(1 - 1/\kappa)(11/κ)越接近1,误差衰减越慢,且易因等高线“细长”出现“楼梯形”迂回路径。

  • 关键影响因子:条件数κ\kappaκ
    定义条件数κ=L/μ\kappa = L/\muκ=L/μ(L与μ的比值),线性收敛的“衰减速度”由κ\kappaκ决定:

    • κ\kappaκ越小(L与μ接近):衰减因子(1−1/κ)(1 - 1/\kappa)(11/κ)越接近0,收敛越快;
    • κ\kappaκ越大(L远大于μ):衰减因子越接近1,收敛越慢,且极易出现“楼梯现象”。

2. PL(Polyak–Lojasiewicz)不等式:宽松条件下的线性型收敛

  • PL条件定义:若存在常数μ>0\mu > 0μ>0,对任意迭代点xxx,函数值差与梯度范数满足以下关系:
    f(x)−f(x∗)≤12μ∥∇f(x)∥22 f(x) - f(x^*) \leq \frac{1}{2\mu} \|\nabla f(x)\|_2^2 f(x)f(x)2μ1∥∇f(x)22
    f(x∗)f(x^*)f(x)为函数最小值,PL条件是强凸性的“弱化版本”——无需函数严格强凸,仅通过“函数值差距”与“梯度大小”的关联约束函数形态)。

  • 收敛结果:即使f(x)f(x)f(x)非强凸,只要满足PL条件,梯度下降仍能实现线性型收敛,函数值差的衰减公式为:
    f(xk)−f(x∗)≤(1−μL)k[f(x0)−f(x∗)] f(x_k) - f(x^*) \leq \left(1 - \frac{\mu}{L}\right)^k \left[f(x_0) - f(x^*)\right] f(xk)f(x)(1Lμ)k[f(x0)f(x)]
    x0x_0x0为初始迭代点,kkk为迭代次数)。(上文已经证明这个不等式)

  • 实际意义:解释了深度学习训练中的常见现象——深度网络的损失函数通常非强凸,但可能满足PL条件,因此训练时损失曲线会呈现“近似线性下降”的稳定趋势。

3. “楼梯现象”:成因与缓解

  • 现象描述:当函数条件数κ=L/μ\kappa = L/\muκ=L/μ过大时,负梯度下降的迭代路径会呈现“楼梯形”(如图标注“条件数大 ⇒ 楼梯路径”):沿细长的等高线(如二次函数的椭圆等高线)迂回前进,每次仅沿等高线短轴方向小幅下降,无法直接逼近最小值点,迭代效率极低。

  • 核心成因:条件数κ\kappaκ过大导致函数等高线“细长扁平”,负梯度方向(沿等高线法向)与“最优下降方向”(沿等高线长轴方向)偏差极大,梯度下降陷入“来回震荡、缓慢逼近”的困境。

  • 缓解方法预条件化(或输入/参数归一化)——通过线性变换(如文档中二次函数的坐标变换y=A1/2xy = A^{1/2}xy=A1/2x)将“细长谷”地形转化为“圆形洼地”,本质是减小条件数κ\kappaκ,使负梯度方向更接近最优下降方向,从而消除楼梯现象。

实践提示

  1. 预条件化的核心价值:通过调整优化空间的度量规则(如引入预条件矩阵),显著降低条件数κ\kappaκ,从根本上改善收敛速度;
  2. 迭代停止准则:无需迭代至完全收敛,满足以下任一条件即可终止:
    • 梯度范数足够小(函数接近平稳):∥∇f(xk)∥2≤ε\|\nabla f(x_k)\|_2 \leq \varepsilon∥∇f(xk)2εε\varepsilonε为预设精度,如10−610^{-6}106);
    • 函数值相对下降不足(继续迭代收益极低):f(xk−1)−f(xk)max⁡(1,f(xk−1))≤ε\frac{f(x_{k-1}) - f(x_k)}{\max(1, f(x_{k-1}))} \leq \varepsilonmax(1,f(xk1))f(xk1)f(xk)ε

五、Newton法:局部二次近似与两阶段收敛

Newton法是比梯度下降更高效的优化方法,核心是通过函数的局部二次近似确定搜索方向,兼具“局部快速收敛”与“全局有效下降”的特性,其核心逻辑围绕“二阶展开→牛顿步→收敛性”展开:

1. 核心思路:函数的局部二次近似

梯度下降仅用“一阶信息(梯度)”将函数局部近似为线性函数,而Newton法引入“二阶信息(Hessian矩阵)”,将函数局部近似为二次函数(更贴合非凸函数的局部曲率),具体如下:

对迭代点xxx,将目标函数f(x+Δ)f(x+\Delta)f(x+Δ)xxx处做二阶泰勒展开(Δ\DeltaΔ为搜索方向向量):
f(x+Δ)≈f(x)+∇f(x)⊤Δ+12Δ⊤H(x)Δ f(x+\Delta) \approx f(x) + \nabla f(x)^\top \Delta + \frac{1}{2}\Delta^\top H(x) \Delta f(x+Δ)f(x)+f(x)Δ+21ΔH(x)Δ
其中:

  • ∇f(x)\nabla f(x)f(x)f(x)f(x)f(x)的梯度(一阶导数);
  • H(x)=∇2f(x)H(x) = \nabla^2 f(x)H(x)=2f(x)f(x)f(x)f(x)的Hessian矩阵(二阶导数矩阵),反映函数在xxx处的局部曲率。

Newton法的核心是:最小化上述二次近似函数,直接求解使近似函数最小的搜索方向Δ\DeltaΔ

2. 牛顿步(Newton Step)的推导

对二阶近似函数关于Δ\DeltaΔ求导,并令导数为0(二次函数的极值点条件):
∂∂Δ[f(x)+∇f(x)⊤Δ+12Δ⊤H(x)Δ]=∇f(x)+H(x)Δ=0 \frac{\partial}{\partial \Delta}\left[ f(x) + \nabla f(x)^\top \Delta + \frac{1}{2}\Delta^\top H(x) \Delta \right] = \nabla f(x) + H(x) \Delta = 0 Δ[f(x)+f(x)Δ+21ΔH(x)Δ]=f(x)+H(x)Δ=0
若Hessian矩阵正定H(x)≻0H(x) \succ 0H(x)0,保证二次近似函数是凸函数,极值点为最小值点),则可解出唯一的搜索方向——牛顿步
Δnt=−H(x)−1∇f(x) \Delta_{nt} = -H(x)^{-1} \nabla f(x) Δnt=H(x)1f(x)

3. 牛顿步的下降性

牛顿步能保证是“下降方向”的前提是H(x)≻0H(x) \succ 0H(x)0,证明如下:
计算梯度与牛顿步的内积(判断方向是否下降的核心指标,内积<0则为下降方向):
∇f(x)⊤Δnt=∇f(x)⊤(−H(x)−1∇f(x)) \nabla f(x)^\top \Delta_{nt} = \nabla f(x)^\top \left( -H(x)^{-1} \nabla f(x) \right) f(x)Δnt=f(x)(H(x)1f(x))
H(x)≻0H(x) \succ 0H(x)0,其逆矩阵H(x)−1H(x)^{-1}H(x)1也正定,故对任意非零向量∇f(x)\nabla f(x)f(x),有∇f(x)⊤H(x)−1∇f(x)>0\nabla f(x)^\top H(x)^{-1} \nabla f(x) > 0f(x)H(x)1f(x)>0,因此:
∇f(x)⊤Δnt<0 \nabla f(x)^\top \Delta_{nt} < 0 f(x)Δnt<0
即牛顿步满足“下降方向”的核心条件。

4. 局部二次收敛:牛顿法的核心优势

当迭代点足够靠近最优解x∗x^*x时,Newton法会呈现二次收敛(收敛速度远快于梯度下降的线性收敛),严格定义如下:

收敛条件

若满足以下两个前提:

  1. Hessian矩阵H(x)H(x)H(x)x∗x^*x的邻域内Lipschitz连续(曲率变化平缓);
  2. 初始迭代点x(0)x^{(0)}x(0)足够靠近x∗x^*x(进入“局部收敛域”)。
二次收敛公式

此时存在常数C>0C > 0C>0,使得迭代误差满足:
∥xk+1−x∗∥≤C⋅∥xk−x∗∥2 \| x_{k+1} - x^* \| \leq C \cdot \| x_k - x^* \|^2 xk+1xCxkx2

结论:
HHH在某邻域内满足 Lipschitz(存在常数MMM使得∣H(x)−H(y)∣≤M∣x−y∣|H(x)-H(y)| \le M|x-y|H(x)H(y)Mxy)且H(x∗)H(x^*)H(x)非奇异的情形,从足够近的初值出发,牛顿迭代局部二次收敛,即存在常数C>0C>0C>0和半径r>0r>0r>0,当∣xk−x∗∣≤r|x_k-x^*| \le rxkxr
∣xk+1−x∗∣≤C∣xk−x∗∣2. |x_{k+1}-x^*| \le C|x_k-x^*|^2. xk+1xCxkx2.
证明(简洁严谨):

设误差ek:=xk−x∗e_k := x_k - x^*ek:=xkx。由∇f(x∗)=0\nabla f(x^*) = 0f(x)=0和一维积分形式的泰勒公式:
∇f(xk)=∫01H(x∗+tek)ek dt. \nabla f(x_k) = \int_0^1 H(x^* + t e_k) e_k \, dt. f(xk)=01H(x+tek)ekdt.
牛顿更新写作:
ek+1=xk−x∗−H(xk)−1∇f(xk)=H(xk)−1(H(xk)−∫01H(x∗+tek)dt)ek. e_{k+1} = x_k - x^* - H(x_k)^{-1} \nabla f(x_k) = H(x_k)^{-1} \left( H(x_k) - \int_0^1 H(x^* + t e_k) dt \right) e_k. ek+1=xkxH(xk)1f(xk)=H(xk)1(H(xk)01H(x+tek)dt)ek.
取范数并用三角不等式得:
∣ek+1∣≤∣H(xk)−1∣∫01∣H(xk)−H(x∗+tek)∣dt⋅∣ek∣. |e_{k+1}| \le |H(x_k)^{-1}| \int_0^1 |H(x_k) - H(x^* + t e_k)| dt \cdot |e_k|. ek+1H(xk)101H(xk)H(x+tek)dtek∣.
利用 Hessian 的 Lipschitz 性质(常数记为MMM):
∣H(xk)−H(x∗+tek)∣≤M∣xk−(x∗+tek)∣=M(1−t)∣ek∣. |H(x_k) - H(x^* + t e_k)| \le M |x_k - (x^* + t e_k)| = M(1 - t)|e_k|. H(xk)H(x+tek)Mxk(x+tek)=M(1t)ek∣.
代入并对ttt积分:
∣ek+1∣≤∣H(xk)−1∣⋅M(∫01(1−t)dt)∣ek∣2=M2∣H(xk)−1∣∣ek∣2. |e_{k+1}| \le |H(x_k)^{-1}| \cdot M \left( \int_0^1 (1 - t) dt \right) |e_k|^2 = \frac{M}{2} |H(x_k)^{-1}| |e_k|^2. ek+1H(xk)1M(01(1t)dt)ek2=2MH(xk)1∣∣ek2.
由于HHH连续且H(x∗)H(x^*)H(x)非奇异,存在半径r>0r>0r>0,使得对所有∣x−x∗∣≤r|x - x^*| \le rxxrH(x)H(x)H(x)可逆,且∣H(x)−1∣≤B|H(x)^{-1}| \le BH(x)1BBBB为该闭球上逆的上界)。因此当∣ek∣≤r|e_k| \le rekr时:
∣ek+1∣≤MB2∣ek∣2. |e_{k+1}| \le \frac{M B}{2} |e_k|^2. ek+12MBek2.
令常数C:=MB2C := \frac{M B}{2}C:=2MB,即得局部二次收敛估计。

直观意义

二次收敛意味着“每次迭代后,误差的有效位数会翻倍”——例如:若第kkk步误差为10−210^{-2}102,第k+1k+1k+1步误差可降至10−410^{-4}104,第k+2k+2k+2步可降至10−810^{-8}108,接近最优解时收敛极快。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值