从SGD到AdamW:优化算法的演化

想象一下,训练一个神经网络,就像把你蒙上眼睛,丢进一片连绵不绝的山脉里,你的任务是找到最低的山谷。

这个“最低山谷”,就是我们模型的最佳状态——损失函数的最小值。

问题来了:你看不见全局地图,只能靠脚下的坡度来判断方向。下一步该往哪走?步子迈多大? 这就是优化器 (Optimizer) 要解决的核心问题。它就像你的智能登山杖,指导你如何高效地“下山”。

一个好的优化器,能带你快速、稳定地到达目的地;而一个差的,可能会让你在某个小山坡上来回打转,甚至迷失方向。

在这篇文章里,我们就来一场优化器的进化之旅。从最简单直接的“凭感觉走”——随机梯度下降(SGD)出发,一步步看它如何变得更聪明、更强大,最终进化成当今大模型训练普遍采用的优化算法——Adam 和 AdamW。

SGD:随机梯度下降

最初的梯度下降法需要一次性把所有数据都扔给模型,通过遍历所有训练数据,计算模型在整个数据集上的总损失(计算出所有样本的损失再计算平均值)然后再计算出梯度,这意味着每一次更新参数都需要遍历整个数据集,虽然说这样计算出来的梯度方向非常准确,但当今数据集普遍都非常庞大,这种方法对算力和内存都有非常高的需求。
SGD的改进方向是每次只遍历一部分的数据,每次只根据这一部分数据计算出来的梯度来更新参数:

\[\theta_{t+1} = \theta_t - \gamma g_t \]

其中\(\theta\)是参数,\(\gamma\)是学习率,\(g\)是梯度。
因为每次只遍历一部分数据(这一部分数据的大小我们称为batch_size),所以梯度的计算会非常快,并且对内存也会更加友好。这个遍历的过程会一直重复,直到遍历完所有数据(这里称作一个Epoch)。
但这种方法也会有一定的缺点,每次只遍历一部分数据意味着充满随机性和噪音,损失函数会有一定的上下波动,收敛过程较慢。
话又说回来,噪音和随机性有时候反而会跳出局部最优解。

Momentum

上面说到在使用SGD算法时,我们有事会遇到震荡的问题,导致模型收敛较慢,这种现象是由于每次迭代后梯度变化较大导致的。
想像一下我们的损失函数像是一个被拉得很长的、像峡谷或椭圆形山谷一样的地形,在这个峡谷里两侧的峭壁非常陡峭,梯度很大。而沿着峡谷底部走向最低点的坡度却非常平缓,梯度很小。我们的目标,是让小球(代表模型参数)从峡谷的一端,平稳地滚动到谷底的最低点。
现在,我们把 SGD 控制的小球放在峡谷的一侧峭壁上。会发生什么?

  1. 第一步: 小球只看脚下,它发现通往对面峭壁的方向是最陡的下坡路(梯度最大)。于是,砰 的一下,它朝着对面冲了过去。
  2. 用力过猛: 由于峭壁方向的梯度很大,这一步的步长可能也很大,导致小球不仅冲到了对面,甚至可能冲到了比起始点更高的位置。
  3. 第二步: 在新的位置,小球再次环顾四周,发现“回头”的方向又是最陡的。于是,砰 的一下,它又朝着原来的方向冲了回去。

这个过程会不断重复。小球就在峡谷的两侧峭壁之间来回“之”字形地反弹、震荡。虽然它整体上确实在向着谷底移动,但这种移动是极其低效和缓慢的。大部分能量都浪费在了这种无意义的左右摇摆上。这就是 SGD 的核心困境:

  • 在梯度变化剧烈的方向上(峭壁方向),它会剧烈震荡,难以稳定。
  • 在梯度变化平缓的方向上(谷底方向),它又因为梯度太小而前进缓慢。
    我们陷入了一个两难境地:如果调大学习率想让它在谷底走快点,它在峭壁上的震荡就会失控;如果调小学习率来抑制震荡,它在谷底的前进速度又会变得遥遥无期。

如何解决?引入“惯性”的力量 —— 动量 (Momentum)
我们该如何让这个小球变得更“聪明”一点呢?问一个简单的问题:一个真实世界里的重铁球会这样来回反弹吗?不会。一个有质量的铁球会带有惯性,或者说动量

  • 在峭壁方向(垂直于峡谷): 铁球冲向对面峭壁时,峭壁会给它一个反作用力。这样一来一回,它在这个方向上的速度会因为反复的碰撞和转向而被抵消掉。
  • 在谷底方向(沿着峡谷): 在这个方向上,重力始终在稳定地拉着它前进。这个方向上的力是持续不断的,所以铁球的速度会不断累积,越滚越快。
    这就是动量法 (Momentum) 的核心思想
    我们给小球增加一个“速度”变量 v,它会累积过去的梯度信息:
  1. 抵消震荡: 在来回震荡的方向上,梯度方向一正一负,反复变化。当把这些梯度加权平均后,它们会相互抵消,使得这个方向上的更新幅度变小。
  2. 加速前进: 在方向一致的梯度上(如峡谷底部),梯度方向始终不变。当把它们加权平均后,会不断累积,使得这个方向上的更新速度越来越快。
    看看在数学上如何实现动量法:

\[\theta_{t+1} = \theta_t - \gamma v_t \]

其中,\(v_t = \mu v_{t-1} + g_t\) 代表当前时刻的梯度;\(\mu\) 参数用于指数加权移动平均,该方法可以减小更早时刻梯度对当前梯度的影响,通常 \(\mu\) 取值为 0.9。
如果说上一时刻的梯度比较陡,也就是梯度是一个较大的负数,那么当前时刻的梯度会被减去一个较大的值,导致参数不会发生太大的变化,就好像小球在冲向谷底时会慢慢刹车,从而减小震荡的程度。

RMSProp

前面提到的优化器中的学习率均是一个固定的参数,但在复杂的、高维的损失函数空间中,不同参数对最终损失的“敏感度”和“重要性”是截然不同的,一个“一刀切”的更新步长会对优化过程造成极大的阻碍。
依旧把损失函数空间比做一个山谷,这个山谷的宽度方向非常陡峭,但长度方向非常平缓,理想的策略是在宽度方向用小步子,在长度方向上用大步子,对应来说就是在损失函数空间在梯度比较大的参数上的学习率比较小,在梯度比较小的参数上的学习率比较大。
RMSProp最核心的优点就是自适应学习率:

\[\theta_{t+1} = \theta_t - \frac{\gamma}{\sqrt{s_t + \epsilon}} g_t \]

其中,\(s_t = \alpha s_{t-1} + (1 - \alpha)g_t^2\) 代表着历史中所有梯度的平方和,\(\alpha\) 代表指数加权移动平均法的参数,它控制了历史梯度信息被遗忘的速度,\(\gamma\)是全局学习率,\(\epsilon\)是一个非常小的数,防止分母为0。
RMSprop 通过\(\sqrt{s_t + \epsilon}\)对每个参数的更新进行了归一化。这使得每个参数都有一个量身定制的学习率,非常适合处理特征稀疏或者不同参数梯度尺度差异巨大的情况(例如在自然语言处理中,某些词的词向量很少被更新)。

Adam

动量法是在梯度上做文章,RMSProp是在学习率上做文章,那能不能把这两种方法结合起来呢?Adam就是二者结合起来的一种优化器:

\[\theta_{t+1} = \theta_t - \frac{\gamma}{\sqrt{s_t + \epsilon}} v_t \]

其中,\(s_t = \beta_2 s_{t-1} + (1 - \beta_2)g_t^2\)\(v_t = \beta_1 v_{t-1} + (1 - \beta_1)g_t\)

AdamW

虽然理论上Adam算法的性能更优,但人民发现Adam有时的表现并不如动量法,尤其是在模型泛化能力上。
我们知道,L2 正则化的目标是防止模型过拟合,通过在损失函数中增加一个惩罚项,惩罚过大的权重。

\[L_{\text{total}} = L_{\text{original}} + \frac{\lambda}{2} \|w\|^2 \]

其中 \(\lambda\) 是正则化强度,\(w\) 是模型的权重。

L2 正则化如何变成“权重衰减”:
当计算总损失的梯度时,这个惩罚项会引入一个新的梯度项:

\[\nabla L_{\text{total}} = \nabla L_{\text{original}} + \lambda w \]

在更新权重时(以 SGD 为例):

\[w_{t+1} = w_t - \eta (\nabla L_{\text{original}} + \lambda w_t) \]

\[w_{t+1} = (1 - \eta \lambda) w_t - \eta \nabla L_{\text{original}} \]

看到 \((1 - \eta \lambda)\) 这一项了吗?它意味着在每次应用梯度更新之前,权重 \(w_t\) 自身都会被乘以一个小于 1 的系数进行“衰减”。这就是权重衰减的由来。对于 SGD 来说,L2 正则化和权重衰减是等价的。

再看看L2正则化在Adam中是怎么样的:

\[\theta_{t+1} \leftarrow \theta_t - \gamma \frac{\beta_1 v_{t-1} + (1 - \beta_1)(g_t + \lambda \theta_t)}{\sqrt{s_t + \epsilon}} \]

我们可以看到\(\lambda\theta_t\)这个旨在让权重衰减的项,本身也被Adam的自适应分母\(\sqrt{s_t + \epsilon}\)给缩放了,这样的后果是对于那些历史梯度比较大的权重,它们的有效权重衰减强度会变得非常小。通常,梯度较大的权重往往是模型中比较重要的、需要被好好正则化的权重。但 Adam 的实现方式反而减小了对这些权重的正则化力度。它将正则化强度和梯度的历史大小错误地耦合在了一起。
AdamW的作者在论文中指出了上述问题,并提出了一种简单而优雅的解决方案:将权重衰减与梯度更新解耦:

\[Adam_{update} =\frac{\gamma}{\sqrt{s_t + \epsilon}} v_t \]

\[\theta_{t+1} = \theta_t - Adam_{update} - \gamma \lambda\theta_t \]

在实际实现过程中还需要进行偏置矫正:
image

打开链接下载源码: https://pan.quark.cn/s/05da658a2377 在信息技术领域中,输入法作为操作系统的一个核心构成部分,赋予了用户利用键盘输入多语种文字的能力。"ime-日语输入法安装必须文件"这一资源是一套为日语输入法部署而设计、包含全部必要元素的集成包,对于那些需要在个人计算机上执行日语文字输入的操作者而言具有不可替代的作用。接下来将深入剖析其中所包含的核心概念。 IME(Input Method Editor,输入法编辑器)是操作系统内的一种软件支持服务,其功能在于为非拉丁字符环境提供文字输入方案,例如中文、日文、韩文等文字系统。在日本地区,IME通常被用来将罗马字(罗马拼音)形式的输入转换为平假名、片假名乃至汉字。此压缩文件内含的日语IME文件夹即为执行这一转换功能的关键要素。 kbdjpn.dll被视为一个关键的系统性文件,其意指“Japanese Keyboard Layout”(日语键盘布局)。该动态链接库文件负责设定日语键盘的排列方式及快捷操作组合,使用户能够借助常规的QWERTY键盘输入日语文字。倘若缺少这一文件,即便已经安装了日语输入法,依然无法正常显示及输入日语字符。 另外,imjp81k.dll同样是一个重要的系统性构成,它属于日语IME的范畴,全称为“Input Method Japanese for Windows 8.1 and later, Katakana mode”(适用于Windows 8.1及更新版本的日语输入法,片假名模式)。该文件支持日语的片假名输入,是处理日语输入的核心组成部分。在安装或升级日语输入法的过程中,保证imjp81k.dll的准确性与完整性显得尤为关键。 压缩包所含的"Window...
内容概要:本文研究了基于DPWMA调制与正负序分离的ANPC三电平并网逆变器前馈控制策略,旨在解决传统三电平逆变器在谐波抑制、电网不平衡适应性及动态响应方面的技术瓶颈。通过构建融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相控制与电网电压前馈的一体化控制体系,全面优化逆变器的输出波形质量、相位同步精度与抗扰能力。文章深入分析了ANPC三电平拓扑的结构优势,如开关损耗均衡、中点电位可控性强和电压利用率高等特点,并设计了包含信号采集、核心控制与调制驱动三层架构的完整控制系统。通过Simulink仿真平台对稳态运行、电网不平衡及动态扰动等多种工况进行验证,结果表明该策略显著降低了总谐波畸变率,提升了锁相精度与系统动态稳定性,有效增强了逆变器在复杂电网环境下的适应能力和运行可靠性。; 适合人群:具备电力电子、自动控制及新能源并网相关基础知识,从事新能源发电、微电网、电力系统仿真等领域的科研人员与工程技术人员,特别适合研究生及以上层次的研究者。; 使用场景及目标:①用于提升大功率并网逆变器在电网电压不平衡、谐波干扰和动态扰动等复杂工况下的运行性能;②为高电能质量要求的应用场景提供先进控制解决方案;③支持科研仿真、论文复现与实际工程项目中的高性能并网控制系统设计与优化。; 阅读建议:建议结合提供的Simulink仿真模型进行实践操作,重点理解DPWMA调制机制、正负序分离锁相算法与电网电压前馈控制之间的协同作用,按照文档结构系统学习,并与传统控制策略进行对比分析,以深入掌握改进策略的技术优势与实现细节。
代码下载链接: https://pan.quark.cn/s/d9794888cbc0 ### G代码经典解释程序知识点详解 #### 一、引言 随着数控技术的持续进步,尤其是开放式数控系统的广泛应用,软件层面的设计在数控领域占据了核心地位。G代码作为数控机床编程的基础语言,在自动化生产流程中发挥着不可或缺的作用。本文的核心内容是关于一个基于Linux平台、采用C语言开发的G代码解释程序的设计思路及其具体实现。 #### 二、G代码解释器概述 **1. 设计背景** - 当前数控技术发展的主要方向是开放式数控系统,这类系统具备出色的可扩展能力、良好的移植性、高度的互换性以及优异的互操作性等优势。 - 计算机硬件技术的快速发展使得在PC平台上构建数控系统成为可能,进而推动了全软件式数控系统的普及。 **2. G代码解释器的重要性** - G代码解释器在全软件式数控系统中是至关重要的组成部分,其主要职责是将G代码转化为数控系统能够识别的数据格式。 - 为了提升数控系统的开放程度,G代码解释器的设计必须兼顾开放性和灵活性。 #### 三、G代码解释器设计与实现 **1. 总体结构设计** - G代码解释器主要由两个核心部分构成:G代码关键字函数表(GKFT)和G代码分组(GG)。 - GKFT用于解析G代码中的关键字,它是解释器的核心骨架;而GG则是语法检查的基础框架。 **2. G代码关键字函数表(GKFT)** - GKFT是一种专门用于存储G代码关键字及其关联处理函数的数据结构。 - 解释器通过查询GKFT,能够根据特定的G代码关键字调用相应的处理函数,从而完成对G代码的有效解析。 - 此种设计方法不仅简化了解释器的构建过程,同时也增强了其可扩展性,因为新增功能...
已经博主授权,源码转载自 https://pan.quark.cn/s/458849d2eac8 Microblaze代表由Xilinx公司研发的一款软核处理器,其核心特性在于使用户能够针对FPGA(Field Programmable Gate Array)平台进行嵌入式系统的个性化构建。此“Xinlin中Microblaze的培训教程”致力于辅助学习人员深入理解和熟练掌握Microblaze在Xilinx开发环境中的实际应用。 一、Microblaze基础 Microblaze作为一款可配置的32位RISC处理器,具备高度适应性,允许在设计中根据具体需求对性能、功耗及面积进行灵活调整。Microblaze支持多种指令集架构(ISA),涵盖Xtensa-like和Classic两种模式,并且与包括UART、SPI、I2C在内的多种外设接口标准保持兼容。 二、Xilinx ISE与Vivado工具 Xilinx ISE(Integrated Software Environment)是一个用于FPGA系统设计、实现和调试的集成开发平台,而Vivado则是一款功能更为先进且全面的工具套件。在本次教程中,学员将学会如何在上述工具中配置和执行Microblaze处理器,以及如何开发相关的硬件描述语言(HDL)代码。 三、Microblaze硬件设计 在Xinlin提供的教程里,学员将学习如何在Xilinx FPGA中部署Microblaze处理器。这涉及到选择合适的处理器配置参数,如时钟频率、缓存容量和外设接口设置。此外,学员还将接触到创建和连接内存模块、中断控制器以及其他必需硬件组件的方法。 四、软件开发 Microblaze的软件开发通常涉及嵌入式编程,采用C或C++语言来...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值