深度学习:属于机器学学习的一个分支,基于深度神经网络模型和方法,通过多层次的非线性变换自动提取和学习数据中的复杂特征表示。
KNN(K近邻算法):是一个基本的监督学习算法,,用于分类(输出任务方式)和回归(输出任务方式)任务。其通过计算新数据点与训练集中各点的距离,找到最近的K个邻居,然后通过邻居的类别或数值来预测新数据点的类别或数值。
比方说:问题为:请判断路人甲是否为清华的或者北大的?
1.以路人甲为基点,找到距离其最近的100个人,其中98个是清华的,这里根据数据样本,我们预测路人甲大概率为清华的
2.以路人甲为基点,找到距离其最近的100个人,其中88个是北大的,这里根据数据样本,我们预测路人甲大概率为北大的
3.以路人甲为基点,找到距离其最近的100个人,其中49个是清华的,51个是北大的,这里根据数据样本,我们无法预测路人甲所属类别
4.以路人甲为基点,找到距离其最近的100个人,其中98个是哈工大的,但是由于题目中问题所问,我们无法确定路人甲是否属于清华或者北大(这是由于K近邻算法用于分类任务,我们可以把分类任务当作是一道选择题,我们只能选择题目给出的选项,而不能自己创造选项),只能通过再次取数据进行预测
监督学习与无监督学习的定义:
监督学习:使用带有标签的数据集训练模型,通过已知的输入和输出学习数据的内在规律,从而对新的未知数据进行预测和分类
无监督学习:使用未标记的数据集训练模型,进而去发现数据中内在结构和关联
决策树算法:是一种经典的机器学习算法,用于解决分类和回归问题,通过构建树形模型,对数据进行分层决策,最终得到预测结果
基本原理:
- 树形结构:决策树是由节点和有向边组成的,节点分为内部节点和叶节点,内部节点表示一个特征或者属性,叶节点表示分类或者回归的结果
- 决策过程:从根节点开始,根据每个节点的特征对数据进行划分,直到到达叶结点,得到最终的预测结果
朴素贝叶斯算法:是一种简单高效的分类算法,基于贝叶斯定理和特征条件独立假设,再文本分类、垃圾邮件过滤、情感分析等领域有广泛应用
优点:
- 算法简单,计算高效,适用于大规模数据集
- 对小规模数据表现良好,适合多分类任务,对缺失数据不敏感
缺点:
- 特征条件独立假设再实际中往往不成立,可能影响分类效果
- 对输入数据的表达形式敏感
常见模型:
1.高斯朴素贝叶斯:适用于连续型数据
2.多项式朴素贝叶斯:适用与离散型数据,常用于文本分类
3.伯努利朴素贝叶斯:适用于二元特征,常用于文本分类
深度学习的目的就是找一个函数f,完成 y = f(x),x就是输入数据,y就是输出结果
神经网络输入的三种数据方式:
1、向量
2、矩阵:例如图片
3、序列:例如视频
神经网络输出的三种任务类别:
1、回归任务:填空题
2、分类任务:选择题
3、生成任务:(简答题)结构化输出,其实是包含了前两种的,例如gpt,文字随机生成等等
例题:请判断下列示例的输入和输出方式:
1.根据一条河十年内三月的水位情况,推测明年三月此河水位?
输入:显然这条河十年的三月水位情况构成了向量
输出:可以理解为根据上文填空,所以输出为回归任务
2.根据视频生成字幕?
输入:视频是由若干个图片按照某种序列通过快速切换得到的动态效果,所以输入是序列
输出:随机生成字幕,所以输出是生成任务
3.自动填充代码?
输入:按照原有代码环境去填充代码,而原来的代码环境是字母组成的序列。所以输入时序列
输出:填充代码可以理解为填空题,所以输出为分类任务,同时填充的代码有自己的内在结构,所以也可以理解为输出为生成任务
4.判断图片中人物是谁?
输入:有图片可知输入为矩阵
输出:有判断字样可得输出为分类任务
5.判断两部动漫是否为同一部?
输入:动漫是视频,所以输入为序列
输出:有判断字样可得输出为分类任务
6.判断淘宝商品的配图和文字标题是否保持一致的?
输入:这里我们容易将视线聚焦再配图上,容易产生文字附属于配图,所以得出输入是矩阵的错误答案,这里恰恰相反,文字是序列,配图附属于文字,属于输入是序列
输出:有判断字样可得输出为分类任务
7.圈出图片中的羊,并且识别为羊?
输入:由图片可知输入为矩阵
输出:判断圈出的动物是不是羊,所以输出为分类任务
8.根据车摄像头看到的画面,把人,路,车的轮廓准确的画出来?
输入:由画面可知输入为矩阵
输出:人车路的轮廓是由一个一个像素点结构化的呈现,所以输出为生成任务

1987

被折叠的 条评论
为什么被折叠?



