神经网络与深度学习课程内容总结二

一、多层前馈网络与BP算法

1.1 多层感知机(MLP)

XOR问题

XOR问题是线性不可分问题的典型代表,单层感知机无法解决。Minsky在1969年提出该问题:

x_{1}

x_{2}

^{}y_{}

0

0

0

1

0

1

0

1

1

1

1

0

解决方案

通过增加隐藏层构成多层感知机,使用三层网络可解决XOR问题:

\begin{aligned} y_1^{[1]} &= f\left(w_{11}^{[1]} x_1 + w_{12}^{[1]} x_2 - \theta_1^{[1]}\right) \\ y_2^{[1]} &= f\left(w_{21}^{[1]} x_1 + w_{22}^{[1]} x_2 - \theta_2^{[1]}\right) \\ y &= f\left(w_1^{[2]} y_1^{[1]} + w_2^{[2]} y_2^{[1]} - \theta\right) \end{aligned}

其中f(\cdot )为阶跃函数。

理论能力

其中,三层阈值网络可实现任意二值逻辑函数;三层S型网络可逼近紧集上的连续函数。

1.2 BP算法

算法流程

    正向传播:输入信号从输入层经隐层传向输出层

    反向传播:误差信号反向传播,利用梯度下降法调整权值和阈值

优缺点

优点

  • 学习完全自主
  • 可逼近任意非线性函数

缺点

  • 非全局收敛
  • 收敛速度慢
  • 学习率选择困难
  • 网络结构设计缺乏理论指导

W \sim U\left[-\frac{\sqrt{6}}{\sqrt{n_j + n_{j+1}}}, \frac{\sqrt{6}}{\sqrt{n_j + n_{j+1}}}\right]

二、神经网络性能优化

2.1 常用技巧

数据划分

  • 训练集、验证集、测试集典型比例:70%-15%-15%或60%-20%-20%
  • K折交叉验证:提高数据利用率

正则化方法

1. L2正则化(权重衰减)

J(w) + \frac{\lambda}{2}\|w\|^2

     梯度更新:\frac{\partial J(w)}{\partial w} + \lambda w

2. Dropout:训练时随机将部分神经元输出置零,防止过拟合

参数初始化

  • Xavier初始化:

W \sim U\left[-\frac{\sqrt{6}}{\sqrt{n_j + n_{j+1}}}, \frac{\sqrt{6}}{\sqrt{n_j + n_{j+1}}}\right]

2.2 优化算法

动量法

解决SGD在山沟状区域震荡的问题,更新公式:

\begin{aligned} v_t &= \alpha v_{t-1} - \epsilon g_t \\ \theta_{t+1} &= \theta_t + v_t \end{aligned}

自适应算法

AdaGrad

  • 自适应调整学习率
  • 累积梯度平方:

r \leftarrow r + g \odot g

  • 参数更新:

\Delta \theta = -\frac{\epsilon}{\sqrt{r + \delta}} \odot g

  1. RMSProp
  • 改进AdaGrad的学习率衰减问题
  • 指数衰减平均:

r \leftarrow \rho r + (1-\rho)g \odot g

Adam

  • 结合动量法和RMSProp
  • 维护一阶矩和二阶矩估计:

\begin{aligned} s &\leftarrow \rho_1 s + (1-\rho_1)g \\ r &\leftarrow \rho_2 r + (1-\rho_2)g \odot g \end{aligned}

  • 偏差修正后更新参数:

\begin{aligned} \hat{s} &\leftarrow \frac{s}{1 - \rho_1^t} \\ \hat{r} &\leftarrow \frac{r}{1 - \rho_2^t} \\ \Delta \theta &= -\epsilon \frac{\hat{s}}{\sqrt{\hat{r} + \delta}} \end{aligned}

三、总结

    本周课程系统介绍了多层前馈神经网络及其训练算法BP,以及各种性能优化技术。关键点包括:

  1. 多层感知机通过增加隐藏层解决线性不可分问题
  2. BP算法通过正向传播和反向传播调整网络参数
  3. 通过正则化、优化算法等技术可显著提升神经网络性能
  4. 自适应优化算法如Adam能自动调整学习率,是目前最常用的优化方法

    这些内容为理解和应用深度学习奠定了坚实基础。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值