【神经网络】感知机算法的收敛性证明

本文深入探讨了感知机算法在面对线性可分数据集时的收敛性。通过定理和直观解释,证明了当样本线性可分时,感知机学习算法将在有限步迭代后收敛到理想的分类超平面。详细分析了两种错误分类情况下的权重更新,展示每次迭代如何使权重向正确方向调整,最终得出误差平方和趋于零的结论。

感知机算法的收敛性

感知机学习算法是否收敛?

  • 定理:假设给定m个输入样本({ X(k)},(k=1,2,...,m)\{X(k)\},(k=1,2,...,m){ X(k)},(k=1,2,...,m))线性可分,那么感知机学习算法的权值就会在有限次的步骤中收敛到理想输出。

    • 定性解释:

      如果两类n维样本线性可分,那么一定存在一个n-1维的平面将其分开,n-1维超平面定义为:

      W(k)=[w0(k),w1(k),...wn(k)]:WTX(k)=0W(k)=[w_0(k),w_1(k),...w_n(k)]:W^TX(k)=0W(k)=[w0(k),w1(k),...wn(k)]:WTX(k)=0

      →w0(k)+w1(k)x1(k)+...+wn(k)xn(k)=0\rarr w_0(k)+w_1(k)x_1(k)+...+w_n(k)x_n(k)=0w0(k)+w1(k)x1(k)+...+wn(k)xn(k)=0

      这个超平面将X(k)X(k)X(k)分为两类:

      W(k)TX(k)>0→y(k)=1→X(k)∈C1W(k)^TX(k)>0\rarr y(k)=1\rarr X(k)\in C_1W(k)TX(k)>0y(k)=1X(k)C1

      W(k)TX(k)<0→y(k)=0→X(k)∈C0W(k)^TX(k)<0\rarr y(k)=0\rarr X(k)\in C_0W(k)TX(k)<0y(k)=0X(k)C0

      在训练过程中,感知机的权重不断地在被调整使得分类结果接近正确分类结果。

    • 定量证明:

      假设存在由理想的权值W∗W^*W确定的理想超平面H∗H^*H,可得到如下结果:

      如果X(k)∈C1X(k)\in C_1X(k)C1,那么XT(k)W∗>0,y(k)=1X^T(k)W^*>0,y(k)=1XT(k)W>0,y(k)=1

      如果X(k)∈C0X(k)\in C_0X(k)C0,那么XT(k)W∗<0,y(k)=0X^T(k)W^*<0,y(k)=0XT(k)W<0,y(k)=0

      证明:学习算法是否能逼近W∗W^*W

      证明:假设W∗W^*W是理想权值,那么任意α>0\alpha>0α>0αW∗\alpha W^*αW也是理想权值。因为有:

      XT(k)αW∗>0X^T(k)\alpha W^*>0XT(k)αW>0,或者 XT(k)αW∗<0X^T(k)\alpha W^*<0XT(k)αW<0

      理性权值不为1,找到一个,乘任一大于0的常数还是理想权值

      所以,算法逼近αW∗\alpha W^*αW也算逼近理想权值

      证明:存在有限值N,使得∥W(N)−αW∗∥2→N↑0\lVert W(N)-\alpha W^*\rVert^2\xrightarrow{N\uparrow}0W(N)αW2N 0

      证明过程:

      根据学习算法,在第k次迭代过程中,可以得到权值:

      W(k+1)=W(k)+η(d(k)−y(k))X(k)W(k+1)=W(k)+\eta(d(k)-y(k))X(k)W(k+1)=W(k)+η(d(k)y(k))X(k)

      ​ 如果在第k次迭代,X(k)X(k)X(k)被正确分类,那么d(k)−y(k)=0,W(k+1)=W(k)d(k)-y(k)=0,W(k+1)=W(k)d(k)y(k)=0,W(k+1)=W(k)

      ​ 如果在第k次迭代中,发生错误分类,那么:

      ​ 情况1:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值