梯度下降法
一、摘要
文本主要讲述了梯度下降法作为机器学习中的一种优化方法,用于最小化损失函数。梯度下降法它的核心思想是通过迭代的方式,沿着目标函数梯度的反方向更新模型参数,使得目标函数值逐渐减小,最终找到目标函数的局部最小值(理想情况下是全局最小值)。它并非直接解决机器学习问题,而是作为求解最优参数的工具。通过二维坐标图直观展示了梯度下降法的原理,即通过调整参数值来逐步减小损失函数值,直至找到最小值点。同时,强调了导数在梯度下降中的作用,即指示了损失函数随参数变化的趋势,从而指导参数调整的方向。
二、梯度下降法
-
概述
1.梯度下降法是机器学习领域的一种重要方法,用于优化目标函数。
2.梯度下降法用于最小化损失函数,而梯度上升法用于最大化效用函数。
3.梯度下降法是解决许多机器学习问题的常用工具,尤其是那些无法直接求解数学解的问题。 -
原理
1.梯度下降法
通过在损失函数上搜索最优解来最小化损失函数。
2.在二维坐标平面上,损失函数的最小值对应于参数θ的某个值。
3.通过计算损失函数对参数θ的导数,确定损失函数增大的方向,并沿其负方向移动。
4.移动的步长称为学习率α,其取值影响算法收敛的速度。




图中内容是关于机器学习中“学习率(η)”的知识点介绍:
1. 学习率(η)是在机器学习优化算法,尤其是梯度下降法中的一个超参数。
2. 它控制着每次参数更新的步长。如果学习率取值较小,算法会更谨慎地更新参数,虽然能保证算法的稳定性,但会使得收敛到最优解的速度变慢,需要更多的训练时间和计算资源。
3. 而如果学习率取值过大,参数更新的步长就会很大,这可能导致算法在搜索最优解的过程中“跳过”最优解,无法收敛,甚至出现发散的情况,也就得不到最优解。
4. 并不是所有函数都有唯一的极值点:

解决办法:
1. 多次运行,随机化初始点
2. 梯度下降法的初始点也是一个超参数 -
示例
1.通过示例说明梯度下降法的具体步骤,包括
计算导数、确定移动方向和步长。
2.梯度下降法的过程类似于球体在山谷中的滚落过程,直到到达谷底。
3.学习率α的取值过大或过小都会影响算法的性能,甚至导致无法找到最优解。 -
注意事项
1.梯度下降法可能陷入
局部最优解,尤其是面对复杂函数时。
2.初始点的选择对梯度下降法的结果有重要影响,不同的初始点可能导致不同的最优解。
3.对于具有多个局部最优解的函数,多次运行梯度下降法并比较结果可以有助于找到更好的解。
三、线性方程中使用梯度下降法
- 线性回归中使用梯度下降法的目标:使 ∑ i = 1 m ( y ( i ) − y ^ ( i ) ) 2 \sum_{i = 1}^{m}(y^{(i)} - \hat{y}^{(i)})^{2} ∑i=1m(y


1万+

被折叠的 条评论
为什么被折叠?



