决策树算法原理

决策树算法概述及原理详解 决策树思想的来源非常朴素,程序设计中的条件分支结构就是if-else结构,最早的决策树就是利用这类结构分割数据的一种分类学习方法。 阅读详情

Decision Tree

在分类模型中,决策树算法绝对是最常用的模型之一,当然目前基本没有人会用单棵决策树去做分类或者回归,都是用的集成的树模型。决策树的思想其实并不复杂,人类在判断一件事物是好是坏,是优是劣的时候,通常是这样做的,比如判断一个男人容不容易找到女朋友:先考虑年龄,太大的找不到,年龄合适的再看工资,太少的找不到,太多的没问题,中等水平的再看有没有房,没房的找不到,有房的再看……那么决策树就是在做这样一种判断,它借助树模型,把每个特征看作是一个节点,对每个特征进行划分,构建起一棵树,如图所示:

在这里插入图片描述

那么当我们拿到一条新数据的时候,预测的过程就是我们上面语言描述的过程。继续这个例子,假设现在有一位人类高质量男性,他30岁、年薪30k,在上海有一套汤臣一品,那么我们把这位人类高质量男性输入我们的决策树,模拟的过程如下:

  1. 年龄30岁,进入左子树
  2. 年新30k,进入左子树
  3. 有房产,进入左子树
  4. 已经是叶子节点了,返回结果:“能找到女朋友”

决策树算法通用形式伪代码如下:

在这里插入图片描述

那么问题来了,我怎么知道以什么顺序去评估每个节点呢?或者说,每当我要递归建树的时候,该怎么去选取我当前的根节点呢?也就是伪代码中“从A中选择最优划分属性a∗a_*a”。答案是不唯一的,但不管是那种度量方法,我们的原则是不变的:按照该特征划分后,数据集的纯度能够越来越高。当下有三种非常经典的决策树模型:ID3、C4.5、CART。下面我们分别来详细介绍

ID3

在介绍ID3之前,我们先来介绍一个信息论当中非常重要的概念:熵

Entropy

信息熵是度量样本集合纯度的一种指标,假设样本集DDD中第kkk个类别的样本占比重为pkp_kpk,那么样本集DDD的信息熵(香农熵)定义为:
Ent(D) = −∑i=1kpklog2pk Ent(D) \ = \ -\sum_{i=1}^kp_klog_2{p_k} Ent(D) = i=1kpklog2pk
Ent(D)Ent(D)Ent(D)越小代表样本集纯度越高。

Information Gain

假设特征aaaVVV个不同的取值{a1,a2,…,aV}\{a^1, a^2,\dots,a^V\}{a1,a2,,aV},如果使用特征aaa对当前样本进行划分,那么就会产生VVV个子结点,定义DvD_vDv表示所有在特征aaa取值为ava^vav的样本集合,那么我们定义按照特征aaa进行划分的信息增益为:
Gain(D,a)=Ent(D)−∑v=1V∣Dv∣∣D∣Ent(Dv) Gain(D, a)=Ent(D)-\sum_{v=1}^V{\frac{|D_v|}{|D|}Ent(D_v)} Gain(D,a)=Ent(D)v=1VDDvEnt(Dv)
之前我们说EntEntEnt越小,样本集纯度越高,那么来观察信息增益的式子,如果信息增益越大,就说明后面的那一项小,也就是EntEntEnt小,那么样本集纯度就得到了提升。因此,ID3算法的划分属性依据就是信息增益,每一次选取剩余特征中信息增益最大的特征最为 当前的节点。
a∗=argmax   Gain(D,a) a^*=argmax \ \ \ Gain(D,a) a=argmax   Gain(D,a)
西瓜书上的这个例子非常的具体,看一遍就能完全理解这个过程

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

Algorithm

输入训练集DDD、特征集AAA、阈值ϵ\epsilonϵ,输出决策树TTT,ID3算法的大体流程如下:

  1. 如果当前DDD中所有样本都属于同一类别,那么TTT为点单点树,并以这个类别作为该节点的类别,返回TTT
  2. 如果A=ϕA=\phiA=ϕ,则TTT为单节点树,返回DDD中样本数最多的类别CCC作为该节点的类别,返回TTT
  3. 否则,计算AAA中所有特征对样本集DDD的信息增益,选取信息增益最大的特征AgA_gAg
  4. 如果AgA_gAgDDD的信息增益小于阈值ϵ\epsilonϵ,那么TTT为单节点树,返回DDD中样本数最多的类别CCC作为该节点的类别,返回TTT
  5. 否则,对于AgA_gAg每一种可能的取值aia_iai,按照Ag=aiA_g=a_iAg=aiDDD划分为若干非空集合DiD_iDi,将DiD_iDi中样本数最多的类别作为当前节点的类别,构建子节点,由该结点和其子结点构成树TTT,返回TTT
  6. 对于第5步中得到的每个子结点iii,以DiD_iDi为训练集,A−{Ag}A-\{A_g\}A{Ag}为特征集,递归地调用第1~5步,得到子树TiT_iTi,返回TiT_iTi

C4.5

下面我们来考虑一下信息增益的缺点:信息增益会偏向特征取值多的特征。举个最极端的例子,每个样本有都有一个编号,假如我们把编号也当做是一个特征,那么很显然,按照编号划分后的样本集纯度是最高的。但这样的模型显然过拟合现象非常严重。为了改进这一缺点,有人提出了C4.5算法。

Gain Ratio

C4.5采用的度量最优划分特征的依据是“信息增益率”,公式为:
Gain_Ratio(D,a)=Gain(D,a)IV(a)IV(a)=−∑v=1V∣Dv∣∣D∣log2∣Dv∣∣D∣ Gain\_Ratio(D,a)=\frac{Gain(D,a)}{IV(a)} \\ IV(a)=-\sum_{v=1}^V{\frac{|D_v|}{|D|}log_2{\frac{|D_v|}{|D|}}} Gain_Ratio(D,a)=IV(a)Gain(D,a)IV(a)=v=1VDDvlog2DDv
其中,IV(a)IV(a)IV(a)可以看作是特征aaa的某种属性值,是一个固定的数。

Algorithm

输入训练集DDD、特征集AAA、阈值ϵ\epsilonϵ,输出决策树TTT,ID3算法的大体流程如下:

  1. 如果当前DDD中所有样本都属于同一类别,那么TTT为单结点树,并以这个类别作为该节点的类别,返回TTT
  2. 如果A=ϕA=\phiA=ϕ,则TTT为单节点树,返回DDD中样本数最多的类别CCC作为该节点的类别,返回TTT
  3. 否则,计算AAA中所有特征对样本集DDD的信息增益,选取信息增益最大的特征AgA_gAg
  4. 如果AgA_gAgDDD的信息增益小于阈值ϵ\epsilonϵ,那么TTT为单节点树,返回DDD中样本数最多的类别CCC作为该节点的类别,返回TTT
  5. 否则,对于AgA_gAg每一种可能的取值aia_iai,按照Ag=aiA_g=a_iAg=aiDDD划分为若干非空集合DiD_iDi,将DiD_iDi中样本数最多的类别作为当前节点的类别,构建子节点,由该结点和其子结点构成树TTT,返回TTT
  6. 对于第5步中得到的每个子结点iii,以DiD_iDi为训练集,A−{Ag}A-\{A_g\}A{Ag}为特征集,递归地调用第1~5步,得到子树TiT_iTi,返回TiT_iTi

CART

CART是Classification and Regression Tree的缩写,这个名字直接点明了CART可以做分类和回归任务,也就是说CART可以处理离散和连续数据(其实上面两个决策树算法也可以处理连续数据,采用的是二分法)。CART决策树是一棵严格的二叉树,对于每个结点,CART会根据GiniGiniGini指数来选取最优的划分特征以及该最优特征下最优的划分值。因此,每个结点的取值只有“是”或“否”(对于数字来说也可以是大于或小于),这也就是CART树是一棵二叉树的原因。

Classification

Gini Index

先来介绍一下基尼指数,基尼指数也是度量样本集纯度的一种指标,设数据集DDD中共有KKK种类别的数据,每种类别占比为pkp_kpk,则数据集DDD的计算公式为:
Gini(D) = 1−∑k=1Kpk2 Gini(D) \ = \ 1 - \sum_{k=1}^Kp^2_k Gini(D) = 1k=1Kpk2
同样的,Gini指数越小,数据集的纯度越高。选择当前特征为AAA,按照AAA的某个值aaaDDD划分为两个子集D1D_1D1D2D_2D2,那么当前划分的基尼指数就是:
Gini_index(D,a)=∣D1∣∣D∣Gini(D1) + ∣D2∣∣D∣Gini(D2) Gini\_index(D,a)={\frac{|D_1|}{|D|}}Gini(D_1) \ + \ {\frac{|D_2|}{|D|}}Gini(D_2) Gini_index(D,a)=DD1Gini(D1) + DD2Gini(D2)
这次,我们选择能使得Gini指数最小的特征和特征值最为最优划分特征和最优划分值。

Algorithm

构建CART决策树的算法过程如下:

  1. 设当前节点的数据集为DDD,计算现有特征对DDD的Gini指数。具体来说,对于每一个特征AAA,根据AAA的每一种取值aaaDDD划分为两个子集D1D_1D1D2D_2D2,计算在给定特征AAA和特征取值aaa的Gini指数。
  2. 在所有可能的特征AAA和特征AAA取值aaa中,选取能够使得Gini指数最小的特征和特征值作为当前的最优划分特征和最优划分特征值。依据最优划分特征和最优划分特征值构建两个子结点,将数据集分配到两个子结点中,具体来说,满足A=a或A≥aA=a或A\ge aA=aAa的样本进入左子结点,不满足的进入右子结点。
  3. 递归调用上述步骤,直至达到递归终止条件,如样本集数量已经小于阈值等
  4. 生成CART决策树

Regression

Min Square Error

之前提到CART可以用来做回归,下面来简单介绍一下。之前在分类任务当中,我们选取结点、划分数据的依据是基尼指数,基尼指数和信息熵一样,都是用来衡量一个集合的不纯度的。但在回归任务中,我们不需要衡量数据集的不纯度(很显然回归任务中的不纯度是非常大的,而且基本不会变),我们只需要衡量回归的误差。那么回归问题最经典常用的误差函数就是MSE,因此,将Gini Index替换为MSE用于特征、特征值选取,并用均值替换多数类别标记,我们就得到了一棵CART回归树。
具体来讲,每次得到两个子集合时,计算   minj,s[minc1∑xi∈R1(j,s)(yi − c1)2 + minc2∑xi∈R2(j,s)(yi − c2)2]其中,j表示特征,s表示特征划分值,R1、R2是划分之后的两个子集合,c1、c2是两个子集合数据的均值 具体来讲,每次得到两个子集合时,计算 \ \ \ min_{j,s}[min_{c_1}\sum_{x_i\in{R_1(j,s)}}(y_i \ - \ c_1)^2 \ + \ min_{c_2}\sum_{x_i\in{R_2(j,s)}}(y_i \ - \ c_2)^2]\\ 其中,j表示特征,s表示特征划分值,R_1、R_2是划分之后的两个子集合,c_1、c_2是两个子集合数据的均值 具体来讲,每次得到两个子集合时,计算   minj,s[minc1xiR1(j,s)(yi  c1)2 + minc2xiR2(j,s)(yi  c2)2]其中,j表示特征,s表示特征划分值,R1R2是划分之后的两个子集合,c1c2是两个子集合数据的均值

Algorithm

在这里插入图片描述

Pruning

其实介绍完三种决策树以后,我们不难发现决策树其实是一个比较容易过拟合的模型,因为随着树的深度变大,结点数变多,模型的泛化能力是会随之减弱的。因此,我们可以对决策树进行剪枝操作来降低模型的复杂度以达到抑制模型过拟合的效果。剪枝的方法有两种:预剪枝后剪枝

Pre-Pruning

预剪枝的主要思想就是在选定特征进行划分之前,先使用测试集进行正确率的测试,以判断是否有必要按照当前这个结点进行展开。简言之,只要按照当前属性进行划分能够提高模型的准确率,那就划分;否则,就把当前结点标记为叶结点,并以样本数最多的类别作为该叶结点的类别标记。

在这里插入图片描述

Post Pruning

后剪枝相对于预剪枝来说复杂了很多。后剪枝是在决策树构建完成后,再自下而上地对所有非叶结点进行剪枝,最终得到一个子树序列{T0,T1,…,Tn}\{T_0, T_1, \dots, T_n\}{T0,T1,,Tn},然后采取交叉验证的方法选出序列中最优的子树作为我们最终的模型。下面,我们介绍几个量

  1. TtT_tTt表示以结点ttt为根节点的子树
  2. ∣Tt∣|T_t|Tt表示子树TtT_tTt中的结点数量(可以认为是子树TtT_tTt的复杂程度)
  3. C(T)C(T)C(T)表示子树TTT对其所包含的训练数据的预测误差,如信息熵、基尼指数
  4. C(t)C(t)C(t)表示把ttt当作单结点树对其所包含的训练数据的预测误差,如信息熵、基尼指数(是3的特例情况)

于是,我们定义Cα(T)C_{\alpha}(T)Cα(T)表示子树TTT的损失函数,那么
Cα(Tt)=C(Tt)+α∣Tt∣ C_{\alpha}(T_t) = C(T_t) + \alpha|T_t| Cα(Tt)=C(Tt)+αTt
考虑我们剪枝的操作,其实就是把一棵子树变成了一棵单结点的树,所以剪枝以后,我们的损失函数就变为了
Cα(t)=C(t)+α C_{\alpha}(t) = C(t)+\alpha Cα(t)=C(t)+α
我们肯定希望的是损失函数能够减小,但同时又不希望树模型的复杂度升高,因此,取折中的办法就是当
Cα(Tt)=Cα(t),即α = C(t) − C(Tt)∣Tt∣ − 1 C_{\alpha}(T_t) = C_{\alpha}(t),即 \\\alpha \ = \ \frac{C(t) \ - \ C(T_t)}{|T_t| \ - \ 1} Cα(Tt)=Cα(t),α = Tt  1C(t)  C(Tt)
我们就进行剪枝。于是,对于初始的决策树T0T_0T0,我们找到能够使得α\alphaα最小的结点进行剪枝得到子树T1T_1T1,然后递归此过程得到T2,T3…TnT_2, T_3 \dots T_nT2,T3Tn

在这里插入图片描述

Multi Variable Decision Tree

上述介绍的决策树模型都是单变量的决策树,什么叫单变量?其实就是在每个结点处,我们只考虑了一种特征的取值,因此如果将分类过程可视化,我们的决策边界都是平行于坐标轴的,如图所示:

在这里插入图片描述

也正是因为我们每次只能画平行线,导致模型的复杂度会比较大,影响了泛化能力。显然,如果我们能够使用斜线,以上图为例,我们可以用两条斜线就实现四条平行线的任务。如果我们把每个特征看作是一个变量xxx,那么单变量相当于是每次用常数函数,多变量相当于是一个所有变量的线性组合,如下图所示:

在这里插入图片描述

因此,多变量决策树就是把每个结点从只考虑单一特征变为考虑多个特征。
斜线,以上图为例,我们可以用两条斜线就实现四条平行线的任务。如果我们把每个特征看作是一个变量xxx,那么单变量相当于是每次用常数函数,多变量相当于是一个所有变量的线性组合。
因此,多变量决策树就是把每个结点从只考虑单一特征变为考虑多个特征。

机器学习实验二】决策树(Decision Tree)及其在图像识别任务上的应用 经典有监督学习算法决策树(Decision Tree) 文章目录经典有监督学习算法决策树(Decision Tree)1.算法简介2.算法思想3.算法训练流程3.1 算法的大致流程3.2 算法的伪代码3.3 经典的属性划分方法3.3.1 先验知识 : 信息熵与条件熵信息熵的Python代码实现3.3.2 信息增益 (代表算法:ID3)信息增益python代码实现3.3.3 信息增益率 (代表算法:C4.5)信息增益率python代码实现3.3.4 基尼系数 (代表算法:CART)信息增益率python代 阅读详情

相关推荐

决策树的理解及实现(小白版附代码)

前言 本文的代码部分均采用伪代码+代码的形式,帮助有些想挑战自己的小白同学可以自己通过伪代码敲出代码! 简介 决策树(Decision Tree)是一种十分常用的分类方法。作为一种有监督学习,它对特征属性和样本标签之间的映射关系进行建模。相对于K-近邻算法决策树的主要优势在于数据形式非常容易理解。而决策树之所以称为树,是因为其处理数据的过程可以用树来表示。理论总是那么难以理解,那我们直接上例子吧...

weixin_43901558的博客 1470

决策树】深入浅出讲解决策树算法原理、构建)

最早的决策树算法是由Hunt等人于1966年提出,Hunt算法是许多决策树算法的基础,包括ID3、C4.5和CART等。决策树算法是一种有监督学习算法,利用分类的思想,根据数据的特征构建数学模型,从而达到数据的筛选,决策的目标。 决策树( Decision Tree) 又称为判定树,是数据挖掘技术中的一种重要的分类与回归方法,它是一种以树结构(包括二叉树和多叉树)形式来表达的预测分析模型。其每个非叶节点表示一个特征属性上的测试,每个分支代表这个特征属性在某个值域上的输出,而每个叶节点存放一个类别。一般,一棵

程序星空实验室 4万+

Decision Tree 是机器学习的门槛?决策树原理,6个优缺点,3个算法,ID3算法自实现

一.scikit-learn中两个决策树算法     scikit-learn决策树算法类库内部实现是使用了调优过的CART树算法,既可以做分类,又可以做回归。分类决策树的类对应的是DecisionTreeClassifier,而回归决策树的类对应的是DecisionTreeRegressor。两者的参数定义几乎完全相同,但是意义不全相同。下面就对DecisionTreeClassifier和DecisionTreeRegressor的一个小结。 一、Decision Tree Classificat.

lindaicoding的博客 1617

决策树主要原理

1、决策树是一种分类器,是一个有向、无环树。 2、树中根节点没有父节点,一个节点可以有1-2个或者没有子节点。 3、每个叶节点都对应一个类别标识C的值;每个内部节点都对应一个用于分割数据集的属性Xi,称为分割属性;每个内部节点都有一个分割判断规则qj。 4、节点n的分割属性和分割判断规则组成了节点n的分割标准。

一位在路上的工程师的博客 1万+

10.【机器学习】十大算法之一决策树(Decision tree)算法原理讲解

决策树是一种广泛应用于机器学习和数据分析领域的算法,它特别适用于分类和回归问题。作为一种监督学习算法决策树通过模仿人类决策过程来构建预测模型。它的核心思想是从数据特征中选择最优的属性作为决策节点,然后根据这个属性的值将数据分成几个子集,这个过程递归地在每个子集上重复,直到满足某个停止条件。决策树的结构可以形象地看作是一棵树,其中根节点代表整个数据集,内部节点代表数据的一个特征属性,叶节点则代表最终的决策结果。从根节点到叶节点的每条路径都代表一个规则,这些规则合在一起就形成了一个完整的决策过程。

weixin_50804299的博客 6647

决策树算法:原理及实例应用

决策树算法是一种监督式机器学习算法,它通过构建一个树状的决策模型来进行分类和预测。决策树由节点(node)和边(branch)组成,每个内部节点代表一个特征属性的测试,每个分支代表一个测试输出,每个叶节点代表一个分类结果。

颜淡慕潇 4217

决策树算法介绍:原理与案例实现!

在这个案例中,我们使用了scikit-learn库中内置的Iris数据集,这是一个经典的多分类问题数据集,包含了三种鸢尾花的四个特征(花萼长度、花萼宽度、花瓣长度、花瓣宽度)和对应的类别标签。剪枝有预剪枝和后剪枝两种策略。预剪枝是在决策树生成过程中提前停止树的生长,而后剪枝则是在决策树生成完毕后,通过移除一些子树来降低模型的复杂度。:在生成完整的决策树之后,可以通过剪枝操作来减小决策树的复杂度,防止过拟合。:根据选定的最优特征及其取值,将数据集分裂成多个子数据集,每个子数据集对应决策树中的一个子节点。

Xiaoxin的博客 2415

人工智能直通车系列15【机器学习基础】(决策树算法原理(ID3、C4.5、CART)决策树模型实现)

人工智能直通车系列正在连载更新中,更新的内容包括Python 基础与数学基础、机器学习基础、深度学习基础、完整学习资料以及详细解释代码示例,关注我,持续学习。

TEUTEU的博客 1458

机器学习-15】决策树(Decision Tree,DT)算法原理与案例实现

决策树算法机器学习领域中的一种重要分类方法,它通过树状结构来进行决策分析。决策树凭借其直观易懂、易于解释的特点,在分类问题中得到了广泛的应用。本文将介绍决策树的基本原理,包括熵和信息熵的相关概念,以及几种经典的决策树算法

qq_38614074的博客 3万+

决策树(Decision Tree)分类算法原理及应用

4.1概述 决策树——是一种被广泛使用的分类算法。相比贝叶斯算法决策树的优势在于构造过程不需要任何领域知识或参数设置。在实际应用中,对于探测式的知识发现,决策树更加适用。 决策树通常有三个步骤:特征选择、决策树的生成、决策树的修剪。 4.2算法思想 通俗来说,决策树分类的思想类似于找对象。现想象一个女孩的母亲要给这个女孩介绍男朋友,于是有了下面的对话: 女儿:多大年纪了? ...

张晨光老师的播客 6957

决策树算法介绍:原理与案例实现

决策树是一个树形结构,其中每个内部节点表示一个属性上的测试,每个分支代表一个测试输出,而每个叶节点代表一种类别(对于分类任务)或输出值(对于回归任务)。

qq_42072014的博客 1221

一文读懂决策树原理算法与应用

本文聚焦机器学习中的决策树模型。详细介绍其分而治之的基本原理,从特征选择、树生成到剪枝的生成过程,以及以熵和信息增益为核心的算法要点。深入分析决策树的优缺点,并结合实例阐述其在实际中的应用,助力读者全面掌握决策树技术。

2501_90186640的博客 1705

决策树 (Decision Tree) 原理简述及相关算法(ID3,C4.5)

Decision Tree 决策树决策树是属于机器学习监督学习分类算法中比较简单的一种,决策树是一个预测模型;他代表的是对象属性与对象值之间的一种映射关系。树中每个节点表示某个对象,而每个分叉路径则代表的某个可能的属性值,而每个叶结点则对应从根节点到该叶节点所经历的路径所表示的对象的值。决策树仅有单一输出,若欲有复数输出,可以建立独立的决策树以处理不同输出。  下面来看个范例,就能很快理解

新手村 2万+

决策树算法介绍:原理与案例实现

决策树算法的工作原理是从根节点开始,根据数据的特征值不断向下分裂,直到达到叶节点,从而得到最终的分类或预测结果。在构建决策树的过程中,需要选择一个合适的特征作为分裂点,以便将数据划分为更纯净的子集。请注意,这个示例中的数据集非常小,而且非常简单,因此构建的决策树可能非常基础。在这个例子中,我们可以删除一些不必要的节点或子树,如“中年-女-咳嗽”这一分支,因为它只包含一个样本且预测结果与实际不符。当然,在实际应用中,决策树算法的实现过程可能会更加复杂,需要考虑更多的因素和优化策略。

m0_56653160的博客 1210

python 决策树_机器学习算法之——决策树模型(Decision Tree Model)原理讲解及Python实现...

所属分类:机器学习摘要这一篇简单介绍一下使用决策树来进行分类任务, 同时我们会对决策树的结果进行可视化的显示. 这里会使用iris的例子进行分析.文章目录(Table of Contents)简介参考资料模型的训练与可视化导入数据集训练决策树模型模型的评价结果的可视化一些问题Make sure the Graphviz executables are on your systems' PATH简介...

weixin_39600837的博客 904

【数据挖掘算法原理决策树模型原理

树模型 决策树: 从根节点开始一步步走到叶子节点(决策) 所有的数据最终都会落到叶子节点,既可以做分类也可以做回归 树的组成 根节点:第一个选择点 非叶子节点与分支:中间过程 叶子节点:最终的决策结果 如何切分特征(选择节点) 问题:根节点的选择该用哪个特征呢?接下来呢?如何切分呢? 目标:通过一种衡量标准,来计算通过不同特征进行分支选择后的分类 情况,找出来最好的那个当成根...

小狐狸 1239

决策树算法原理和实现

决策树(Decision Tree)分类算法原理及应用 4.1 概述 决策树——是一种被广泛使用的分类算法。相比贝叶斯算法决策树的优势在于构造过程不需要任何领域知识或参数设置。在实际应用中,对于探测式的知识发现,决策树更加适用。 决策树通常有三个步骤:特征选择、决策树的生成、决策树的修剪。 4.2 算法思想 通俗来说,决策树分类的思想类似于找对象。现想象一个女孩的母亲要给这个女孩介绍男朋友,于是...

xuxu96 2409

决策树算法介绍 - 原理与案例实现

决策树是一种树形结构,其中每个内部节点表示一个属性测试,每个分支代表一个测试结果,而每个叶节点则代表一个类标签(在分类树中)或一个连续值(在回归树中)。决策树的构建过程就是不断地选择最佳属性进行分裂,直到满足某些停止条件。

2301_79262050的博客 1275
上一篇: 朴素贝叶斯算法原理
下一篇: KNN详解
lzk_nus
博客等级 码龄8年 53粉丝 81原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值