6、常见监督分类算法详解

常见监督分类算法详解

1. 小数据集逻辑回归与决策树

在处理较小数据集的逻辑回归时,可以考虑使用精确逻辑回归。需要注意的是,截至2017年末,scikit - learn中决策树的实现(如 sklearn.tree.DecisionTreeClassifier 等基于树的学习器)不能很好地处理分类数据。如果使用整数标签对分类变量进行编码(例如使用 sklearn.preprocessing.LabelEncoder ,而不是 sklearn.preprocessing.OneHotEncoder pandas.get_dummies() 函数),这些变量会被错误地当作数值变量处理。尽管有维护者称像 sklearn.tree.RandomForestClassifier 这样的模型在实践中对被错误编码为整数特征的分类特征具有较强的鲁棒性,但还是强烈建议在将分类变量输入到scikit - learn的决策树之前,将其转换为虚拟变量或独热编码变量。预计在2018年,基于树的学习器会有新特性支持分类分割(每个特征最多64个类别)。

决策树是一种非常通用的监督学习模型,具有易于解释的重要特性。它是一种二叉树数据结构,用于做出决策。树是一种直观的数据展示和分析方式,甚至在机器学习领域之外也广泛应用。决策树能够预测分类值(分类树)和实值(回归树),并且可以直接处理数值和分类数据,无需进行归一化或创建虚拟变量,这使得它成为机器学习中的热门选择。

下面是典型的自顶向下构建决策树的步骤:
1. 初始分割

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值