一、多层前馈网络与BP算法
1.1 多层感知机(MLP)
XOR问题
XOR问题是线性不可分问题的典型代表,单层感知机无法解决。Minsky在1969年提出该问题:
|
|
| |
|
0 |
0 |
0 |
|
1 |
0 |
1 |
|
0 |
1 |
1 |
|
1 |
1 |
0 |
解决方案
通过增加隐藏层构成多层感知机,使用三层网络可解决XOR问题:
其中为阶跃函数。
理论能力
其中,三层阈值网络可实现任意二值逻辑函数;三层S型网络可逼近紧集上的连续函数。
1.2 BP算法
算法流程
正向传播:输入信号从输入层经隐层传向输出层
反向传播:误差信号反向传播,利用梯度下降法调整权值和阈值
优缺点
优点:
- 学习完全自主
- 可逼近任意非线性函数
缺点:
- 非全局收敛
- 收敛速度慢
- 学习率选择困难
- 网络结构设计缺乏理论指导
二、神经网络性能优化
2.1 常用技巧
数据划分
- 训练集、验证集、测试集典型比例:70%-15%-15%或60%-20%-20%
- K折交叉验证:提高数据利用率
正则化方法
1. L2正则化(权重衰减):
梯度更新:
2. Dropout:训练时随机将部分神经元输出置零,防止过拟合
参数初始化
- Xavier初始化:
2.2 优化算法
动量法
解决SGD在山沟状区域震荡的问题,更新公式:
自适应算法
AdaGrad:
- 自适应调整学习率
- 累积梯度平方:
- 参数更新:
- RMSProp:
- 改进AdaGrad的学习率衰减问题
- 指数衰减平均:
Adam:
- 结合动量法和RMSProp
- 维护一阶矩和二阶矩估计:
- 偏差修正后更新参数:
三、总结
本周课程系统介绍了多层前馈神经网络及其训练算法BP,以及各种性能优化技术。关键点包括:
- 多层感知机通过增加隐藏层解决线性不可分问题
- BP算法通过正向传播和反向传播调整网络参数
- 通过正则化、优化算法等技术可显著提升神经网络性能
- 自适应优化算法如Adam能自动调整学习率,是目前最常用的优化方法
这些内容为理解和应用深度学习奠定了坚实基础。

1812

被折叠的 条评论
为什么被折叠?



