机器学习基础概念复习

目录

1、聚类算法

常用算法:

2、降维

常用算法:

3、集成学习boosting/bagging

4、决策树

5、随机森林

6、GBDT梯度下降决策树


1、聚类算法

属于无监督学习。目标是将一组未标记的数据对象自动分组(称为“簇”),使得同一个簇内的对象彼此相似,而不同簇中的对象彼此不相似。用于发现数据内在的结构、模式或分组,用于数据探索、客户细分、异常检测、图像分割等。

常用算法:

K-Means:预先指定要分成 K 个簇。算法随机选择 K 个点作为初始“簇中心”。然后反复进行两个步骤:1) 将每个数据点分配给距离它最近的簇中心所属的簇;2) 重新计算每个簇的中心(取该簇所有点的均值)。直到簇中心不再发生显著变化或达到迭代次数限制。采用距离度量(通常是欧氏距离)

简单高效,适合球形簇。对初始中心敏感,对异常值敏感,不能很好处理非球形簇或大小差异大的簇。

DBSCAN:

  • 核心点: 在其半径为 eps 的邻域内至少包含 minPts 个点的点。

  • 边界点: 落在某个核心点的邻域内,但自身邻域内点数不足 minPts 的点。

基于密度的聚类。不需要预先指定簇数。随机选一个未访问点。如果是核心点,则以其为核心开始扩展簇:将其邻域内所有点(核心点或边界点)加入该簇,并递归地将邻域内的新核心点的邻域点也加入。重复直到该簇无法扩展。然后访问下一个未访问点。最后未被归入任何簇的点是噪声。

 能处理任意形状簇和噪声,不需要指定簇数。对参数 (epsminPts) 敏感,在高维数据上效果可能下降(“维度灾难”),对密度差异大的簇处理不佳。

2、降维

将高维空间中的数据点映射到一个更低维度的空间(通常是 2D 或 3D 以便可视化,或者为了减少特征数量)。

  • 缓解维度灾难: 高维空间数据稀疏,距离计算困难,模型容易过拟合。降维可以减少冗余和噪声,提高学习算法的效率和效果。

  • 数据压缩: 减少存储空间和计算成本。

常用算法:

主成分分析PCA: 寻找数据中方差最大的方向(称为主成分),并将数据投影到这些方向上。第一个主成分捕获最大方差,第二个主成分与第一个正交并捕获剩余方差中的最大值,以此类推。

计算数据的协方差矩阵的特征值和特征向量。特征向量定义了主成分的方向,特征值的大小表示该主成分所捕获的方差量。选择前 K 个最大特征值对应的特征向量构成投影矩阵。新特征(主成分)是原始特征的线性组合,彼此正交(不相关)。需要数据标准化/归一化。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值