使用R并行方式对数值型数据离散化
数据的特征按照其取值可以分为连续型和离散型。离散数值属性在数据挖掘的过程中具有重要的作用。比如在信用卡评分模型中,当自变量很多时,并非所有字段对于目标字段来说都是有效的,因此通常的做法是通过计算woe值和iv值(类似于信息增益)来初步挑选通过对目标变量重要的字段,然后建模逻辑回归模型。而这当中就需要对数值型数据离散化。
数值型数据离散化通常分为有监督离散化和无监督离散化。考虑到数据建模通常是建立目标字段和其影响因素之间的关系的量化,因此会选择有监督离散化。
R语言中用于数值型数据离散化的包discretization。安装和加载如下:
>install.packages("discretization")
>library(discretization)

本文介绍了使用R语言的discretization包进行数值型数据离散化,特别是在数据挖掘中,离散化有重要作用。文中详细阐述了有监督离散化的选择,并展示了使用mdlp()函数的例子。当数据量和维度增加导致处理时间增长时,文章提出通过并行计算优化,利用parallel包的parLapply()函数进行并行离散化,以提高效率。

8062

被折叠的 条评论
为什么被折叠?



