【深度学习常见问题——激活函数】

endnote让参考文献整整齐齐 这篇文章主要是针对利用 endnote 插入参考文献时,参考文献第一行和后面的行对不齐的问题 下面是示意图 可以看到我们的参考文献对的整整齐齐的,比较好看。 下面介绍具体步骤 1、打开endnote。编辑我们使用的参考文献样式。我这儿是叫 ZZ_MODIFIED_GEEBINF 复制 2、找到布局,每个参考开头,将光标放在在参考开头后面,点插入字段,制表符 3、右下角悬挂式输出哪儿选择全部段... 阅读详情

激活函数的作用

增加非线性因素,解决线性模型表达能力不足的缺陷:如果没有激活函数,则会导致多个线性层直接叠加,这样的结果仍未线性层,和单一的线性层表达能力是一样的。

激活函数的基本要求

非线性,处处可微,非饱和,单调,zero-centered,最好计算简单

Sigmoid

1. 曲线
在这里插入图片描述
2. 公式
f ( z ) = 1 1 + e − z f(z) = \frac{1}{1+e^{-z}} f(z)=1+ez1

3. 特点
取值范围 ( 0 , 1 ) (0,1) (0,1),单调连续、处处可微(指的是处处光滑,没有间断点、尖点等)
4. 缺点
1)左右两侧都为饱和区,导数很小,容易导致梯度消失;
2)涉及指数运算,复杂度较高
3)输出值不以0为中心,会导致模型的收敛速度变慢

Tanh

1. 曲线
在这里插入图片描述

2. 公式

f ( z ) = e z − e − z e z + e − z f(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}} f(z)=ez+ezezez

3. 特点
取值范围 ( − 1 , 1 ) (-1,1) (1,1),单调连续,处处可微,一般用于隐藏层和二分类的输出层
4. 与sigmoid相比优劣
1)仍存在近似饱和区,且范围比sigmoid更大,容易发生梯度消失
2)在0附近导数更大,梯度更大,收敛速度会加快
3)均值为0

ReLU

1. 曲线
在这里插入图片描述

2. 公式
f ( z ) = { 0 x≤0 x x>0 f(z)= \begin{cases} 0& \text{x≤0}\\ x & \text{x>0} \end{cases} f(z)={0xx≤0x>0

3. 优点
1)没有指数运算,计算简单高效
2)在正区间没有饱和区,解决梯度消失问题
3)负区间为0,单侧抑制,提高了网络的稀疏表达能力
4)收敛快,大约为sigmoid, tanh的6倍
4. 缺点
1)存在死区,会可能会导致部分神经元失活,导致参数无法更新,训练失败

Leaky ReLU

1. 曲线
在这里插入图片描述

2. 公式
f ( z ) = { 0.01 x x≤0 x x>0 f(z)= \begin{cases} 0.01x& \text{x≤0}\\ x & \text{x>0} \end{cases} f(z)={0.01xxx≤0x>0
3. 优点
1)ReLU的所有优点
2)不会出现死区,解决了负区间神经元失活的情况
4. 缺点

Swish

1. 曲线
在这里插入图片描述

2. 公式

f ( x ) = x ∗ s i g m o i d ( β x ) f(x)=x*sigmoid(\beta x) f(x)=xsigmoid(βx),其中 β \beta β是个常数或可训练参数
3. 优点
无上界有下界、平滑、非单调

Mish

1. 曲线

在这里插入图片描述

2. 公式

f ( x ) = x ∗ t a n h ( l n ( 1 + e x ) ) f(x)=x*tanh(ln(1+e^x)) f(x)=xtanh(ln(1+ex))

3. 优点
平滑的激活函数允许更好的信息深入神经网络,从而得到更好的准确性和泛化能力

Softmax

1. 公式
S i = e i ∑ j e j S_i = \frac{e_i}{\sum_je_j} Si=jejei

2. 特点
1)适用于多分类问题且类别之前互斥的场和,这与sigmoid是不同的:
sigmoid适用于多类别不互斥的情况,而softmax适用于类别互斥的情况
2)因为使用了指数,所以会导致大的值更大,小的值更小,增加了区分对比度,学习效率更高

参考资料

  1. 神经网络中的激活函数(activation function)
深度学习常见问题解答 Sigmoid:Sigmoid函数将输入映射到一个介于0和1之间的值,适用于二分类问题或需要将输出限制在特定范围内的问题。使用Batch Normalization:批标准化是一种常用的技术,通过对每批输入进行标准化,使得网络中间层的输入分布更加稳定,有助于缓解梯度消失和梯度爆炸问题。Dropout:在训练过程中,随机将一部分神经元的输出置为0,以减少不同神经元之间的依赖关系,从而增强模型的泛化能力。减少网络层数:如果问题可以在浅层网络中得到解决,可以尝试减少网络的深度,从而减轻梯度消失和梯度爆炸的问题。 阅读详情

相关推荐

【用unity实现100个游戏之19】制作一个3D传送门游戏,实现类似鬼打墙,迷宫,镜子,任意门效果(附项目源码)

本文介绍了Unity中实现传送门效果的完整流程。通过第一人称角色控制器实现移动,使用PortalView脚本和自定义Unlit Shader渲染门内场景,巧妙利用相机位置和旋转同步实现动态视角。重点解决了近裁剪面问题,确保远距离渲染正确性。最后通过PortalTeleporter脚本实现传送功能,检测碰撞并计算相对位置进行瞬移。该方法无需复杂插件,代码简洁高效,适用于各类3D场景中的传送门实现。

向宇的博客,专注php/web全栈 unity游戏开发,欢迎大家评论纠错 1万+

激活函数

1.激活函数的要求 评价激活函数是否有用的主要因素: (1)该函数应是单调的。这样输出便会随着输入的增长而增长,从而利用梯度下降法寻找局部极值点成为可能。 (2)该函数是可微分的。以保证该函数定义域内的任意一点上的导数均存在,从而使得梯度下降法能够正常使用来自这类激活函数的输出。 -*-任何满足这些条件的函数都可以用作激活函数。 2.常用激活函数 (1)tf.nn.relu 线性修正单元,也叫斜坡...

lin的博客 532

(全新整理)全国33个省228189个矿产地位置分布数据,含经纬度坐标/CSV格式(2021版)

1、资源内容地址:https://blog.csdn.net/2301_79696294/article/details/1404207162、代码特点:今年全新,手工精心整理,放心引用,数据来自权威,相对于其他人的控制变量数据准确很多,适合写论文做实证用 ,不会出现数据造假问题3、适用对象:大学生,本科生,研究生小白可用,容易上手!!!3、课程引用: 经济学,地理学,城市规划与城市研究,公共政策与管理,社会学,商业与管理在以上网站基础上面,整理了中国33个省228189个矿产地位置分布数据,含经纬度坐标/CSV格式,每个矿产数据包含:“矿产地名称”“经度”“纬度”“交通位置”“利用现状”“地质工作程度”“矿床成因类”“矿种规模”如下:在这里插入图片描述

激活函数-activation function

激活函数,梯度爆炸和梯度消失以及解决对应问题的方案。

weixin_50164178的博客 1552

人工智能-深度学习-神经网络-激活函数

激活函数通过引入非线性来增强神经网络的表达能力,对于解决线性模型的局限性至关重要。由于反向传播算法(BP)用于更新网络参数,因此激活函数必须是可微的,也就是说能够求导的。

dgsiwbe的博客 1282

神经网络——激活函数

激活函数 激活函数 fANf_{AN}fAN​ 接收节点输入信号和偏差,以 x=net−θx=net-\thetax=net−θ 表示,决定输出。一个好的激活函数需要满足以下条件: (1)非线性,即导数不是常数,其目的在于保证多重网络不退化成单层线性网络; (2)几乎处处可微:可微性保证了再梯度优化中梯度的可计算性; (3)计算简单:激活函数神经网络前向传播过程中的使用次数与神经元的个数成正比,因此保证其计算的简单性是很有必要的; (4)非饱和性(saturation):饱和指的是在某些区间梯度接近于零(

qq_41536160的博客 1295

深度学习笔记(六):激活函数常见问题总结

激活函数深入理解!

不积跬步,无以至千里! 5109

深度学习常见问题分类的最后一层激活函数和损失损失函数

qq_35672147的博客 2047

激活函数的竞争:不同激活函数之间的比较

1.背景介绍 在深度学习领域,激活函数神经网络中非常重要的组成部分之一。它们决定了神经网络中的神经元如何处理输入信号,以及如何输出结果。激活函数的选择对于神经网络的性能和准确性有着重要影响。在过去的几年里,研究人员和实践者一直在寻找最佳的激活函数,以提高神经网络的性能。 本文将从以下几个方面进行探讨: 背景介绍 核心概念与联系 核心算法原理和具体操作步骤以及数学模型公式详细讲解 具体代码...

AI天才研究院 1281

深度学习中常见损失函数&激活函数

损失函数损失函数:分类用交叉熵,回归用MSE/MAE。:类别不平衡时选择Focal Loss或Dice Loss。:异常值多时选用Huber Loss。:GAN需配合对抗损失,检测任务需IoU-aware损失(如DFL)。激活函数

weixin_38991876的博客 415

激活函数的选择与反向传播算法的性能

1.背景介绍 随着人工智能技术的发展,深度学习成为了一个热门的研究领域。深度学习主要包括神经网络、卷积神经网络、递归神经网络等多种模型。这些模型的核心算法是反向传播算法,其中激活函数的选择对算法性能和模型效果有很大影响。 在这篇文章中,我们将从以下几个方面进行阐述: 背景介绍 核心概念与联系 核心算法原理和具体操作步骤以及数学模型公式详细讲解 具体代码实例和详细解释说明 未来发展趋势与挑战...

AI天才研究院 1009

DL-《深度学习》整理

深度学习》 6.3 隐藏单元《深度学习》 7.3 正则化与欠约束问题所谓分布式表示就是用不同的特征,通过组合来表示不同的概念(左)是 one-hot 表示(一种稀疏表示),(右)为分布式表示神经网络如何学习分布式表示- 百家号。

xiaoshun007的专栏 784

ML与DL中的一些基础知识---激活函数与损失函数等

1. 常用激活函数 (1) sigmoid函数 公式:f(x)=11+e−xf(x)=\frac{1}{1+e^{-x}}f(x)=1+e−x1​ 求导:∂f∂x=f(x)(1−f(x))=ex(1+ex)2\frac{\partial f}{\partial x}=f(x)(1-f(x))=\frac{e^x}{(1+e^x)^2}∂x∂f​=f(x)(1−f(x))=(1+ex)2ex​ ...

逗逗的博客 623

第一周:深度学习基础入门与思考

2.1.AlexNet有哪些特点,为什么可以比LeNet取得更好的性能?AlexNet是一种深度卷积神经网络,在 2012 年 提出1并在ImageNet 竞赛中以显著优势击败传统方法,推动了深度学习的复兴。AlexNet具有以下特点:—(1)更深的网络结构:AlexNet有5个卷积层和3个全连接层和约 6000 万参数,而LeNet只有2个卷积层和3个全连接层以及6万参数。并且AlexNet能更深的层级能学习更复杂的特征(从边缘→纹理→物体部件→整体),更好地捕捉图像数据中的细节和语义信息。

一个研究生的博客 971

常见的激活函数介绍

激活函数的介绍

LC的博客 895

【小白深度学习入门】【1】卷积神经网络CNN 结构、基本原理以及常见问题详解

【小白深度学习入门】【1】卷积神经网络CNN 结构、基本原理以及常见问题详解

阿旭的博客 2357

春节快乐!(深度学习理论相关文章整理)

点击上方“AI公园”,关注公众号,选择加“星标“或“置顶”导读过年了,我们的公众号也三个多月了,发的文章也超过了100篇,趁着过年的机会,给大家做个整理,将一些大家比较喜...

AI公园 187

深度学习debug沉思录

前言: 接触深度学习也有一两年了,一直没有将一些实战经验整理一下形成文字。本文打算用来纪录一些在深度学习实践中的调试过程,纪录一些经验之谈。因为目前深度学习业界的理论基础尚且薄弱,很多工程实践中的问题没法用理论解释得很好,这里的只是实践中的一些经验之谈,以供参考以及排错。本文将持续更新。 如有问题请指出,联系方式: e-mail: FesianXu@163.com QQ: 973926198 gi...

机器学习杂货铺1号店 3759

深度学习——常见问题与优化改进

在 PyTorch 中,L1 需手动加入损失,对于加了L1正则的神经网络,大部分深度学习框架自带的优化器训练获得不了稀疏解;Dropout 随机让一部分神经元 “失效”(输出为 0),使模型无法依赖固定的神经元组合,被迫学习更广泛、更具代表性的特征。当梯度的 “大小” 超过预设阈值时,按比例缩小梯度,使其控制在合理范围内,保证参数更新的稳定性。是指模型在训练数据上都表现不好,说明模型太简单,无法捕捉数据中的规律。:训练数据中某些类别样本太少,导致模型偏向多的类别,分类效果差。决定每次更新参数的步长。

2303_77489296的博客 1017

深度学习的模型梯度从头到尾都为0

深度学习的模型梯度从头到尾都为0 其实就是模型的最后一个激活函数,或者卷积模块的梯度为0,可以把他注释看看。

weixin_42500632的博客 3201
上一篇: 【深度学习常见问题——NMS】
下一篇: 【深度学习常见问题——评价指标】
书玮嘎
博客等级 码龄7年 111粉丝 · 33原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值