本质:将多分类学习任务拆为若干个二分类任务求解,先对问题进行拆分,然后将拆出的每个问题进行二分类任务训练成一个分类器,在测试时对这些分类期预测结果进行集成以获得最终的多分类结果。
经典的拆分方法有三种:一对一(OvO),一对剩余(OvR),多对多(MvM)。
OvO:将N个类别两两配对,从而产生N(N-1)/2个分类任务。eg:将类别区分为Ci和Cj,训练一个分类器,该分类器将D中的Ci划分为整比例,Cj划分为反比例,在测试阶段,将新样本同时提交给所有的分类器,可以得到N(N-1)/2个分类结果,最终结果通过投票产生,把被预测的最多的类别作为最终分类结果。
OvR:每次将一类样本作为整比例,其余作为反比例来训练N个样本分类器,在测试时若仅有一个分类预测为正,对应的类别标记作为最终分类结果。

OvO与OvR对比:
1,OvR只需要训练N个分类器,OvO需要N(N-1)个分类器,所以OvO比OvR的存储开销和测试时间大。
2,在训练时,OvO仅用到两个样例,OvR需要用到全部的样例,因此在训练时,OvO比OvR的训练时间开销要小。因此在类别较多时,OvO比OvR的训练时间开销要小,但是在性能上,取决于数据分布,在多数情况下,两者差不多。
MvM:是每次将若干个类作为正类,若干个类作为反类,最常用的MvM技术是纠错输出码(ECOC)
ECOC的主要过程分两步,编码和解码
编码:对N个类别进行M次划分(类别划分通过编码矩阵,编码矩阵有多种形式,主要的有二元码和三元码。),每次划分将一部分类别划分为正类,一部分为反类,从而形成二分类训练集,这样以工农产生M个训练集,可以训练M个分类器。
解码:M个分类器分别对测试样本进行预测,这些预测标记组成一个编码,将这个预测编码与每个样本类别各自的编码进行比较,返回其中距离最小的类别作为最终预测结果。
对于同一个学习任务,ECOC编码越长,纠错能力越强,同时也意味着所需要的分类器也越多,计算、存储开销都会增大;另一方面,对有限个类别数,可能的组合数目是有限的,码长超过一定的范围也就失去了意义。对于同等长度的编码,理论上,任意两个类别之间的编码距离越远,则纠错能力就越强,因此,在码长较小时可根据这个原则计算最优编码。
分类不平衡问题:
基本策略----再缩放
对于正反比例有偏差的分类(正少反多),可以对数据进行再缩放。解决方法:1,对反样例进行欠采样,或者对正样例进行过采样,使得正反样例的偏差缩小,2,直接训练,移动判定阈值。
欠采样:若随机丢弃可能丢失重要信息,代表算法Easy Ensemble,利用集成学习机制,将反样例划分为若干个集合,工不同学习器使用,这样对每个学习器来看都进行了欠采样,从全局来看,不会丢失重要信息。
过采样:不能简单地对初始样本进行重复采样,否则导致严重的过拟合,代表算法是SMOTE,是通过对训练集的正比例进行插值额外产生正比例。

2162

被折叠的 条评论
为什么被折叠?



