逻辑回归的代价函数(Cost function of logistic regression)
跟之前线性代数的代价函数不一样的是,我们将后面的平方差项定义出来,即,在实际应用中,我们发现如果像处理线性回归的问题一样用这个代价函数来处理分类问题的参数,由于假设函数sigmoid是非线性的,把它带入到
函数后再带入到代价函数的话,呈现的图像是非凸函数,是不断波动的,如下图:

凸函数与非凸函数图像对比
从图像中我们可以看到,非凸函数的图像中有很多局部最优解,如果用梯度下降来处理,我们并不能保证它能收敛到全局最小值。所以我们要做的是找到另一个代价函数,使其能够表现出凸函数的性质,从而能让算法在应用时能收敛到全局最小值。
让我们来重新定义一个新的代价函数:,让我们来看
时的图像:

y=1时的代价函数图像
从图中我们可以观察到,当时,函数值为0;但要注意到当
时,函数值趋近于正无穷。以肿瘤病人的分类问题来理解,就是当假设函数输出为0,也就是说肿瘤病人的肿瘤为恶性肿瘤的概率为0,但此时
又说明肿瘤是恶性肿瘤的概率非常非常大,那么我们就用非常大的代价值来惩罚这个学习算法,使其尽可能减少这种情况的发生。
类似的,从的图像中我们能观察到当
时,函数值趋近于正无穷,那么此时同样会用非常大的代价值来惩罚这个学习算法,使其尽可能减少这种情况的发生,如下:

y=0时的代价函数图像
简化代价函数与梯度下降(Simplified cost function and gradient descent)
尽管我们把分类问题的代价函数的表达式写了出来,但这个式子看起来比较复杂,还要分两种情况,那么我们可不可以把它写成一个式子呢?
我们可以写成这样:,由于
的值只可能是0或1,那么通过与1的相减我们就可以将其写成一个等式了,代入到之前的式子就是:
。
而我们做这么多工作,最核心的目标还是算出某个参数从而得到的最小值,那么如果我们用梯度下降算法来最小化它,将其带入到
,我们会惊奇地发现当我们将其进行微分计算后,会得到
,这跟线性回归时的式子是一样的,但两者之间假设函数的定义式子是不一样的,所以这看起来一样的式子在定义里实际上是完全不同的。
学习内容来自于b站吴恩达大佬课程:https://www.bilibili.com/video/BV1By4y1J7A5?spm_id_from=333.788.player.switch&vd_source=867b8ecbd62561f6cb9b4a83a368f691&p=1

199

被折叠的 条评论
为什么被折叠?



