关于AUC的部分理解和计算可以参考:https://blog.csdn.net/lieyingkub99/article/details/81266664?utm_medium=distribute.pc_relevant.none-task-blog-title-1&spm=1001.2101.3001.4242
但是上文中对计算AUC的第二种方法的解释不太好,这里理解一下。
基于上文中的方法一:
(1)假设有MMM个正样本,NNN个负样本,正负样本两两组合,共M∗NM*NM∗N组。
(2)初始化P=0P=0P=0。使用二分类器对每一组的两个样本进行预测,
如果分类器预测的该正样本是正样本的概率大于该负样本是正样本的概率,则P+1P+1P+1;
如果分类器预测的该正样本是正样本的概率小于该负样本是正样本的概率,则PPP不变;
如果分类器预测的该正样本是正样本的概率等于该负样本是正样本的概率,则P+0.5P+0.5P+0.5。
(3)AUC=P/(M∗N)AUC=P/(M*N)AUC=P/(M∗N)。
将方法一变形,得到公式化的方法二:
(1)使用二分类器对所有的正负样本进行预测,获取他们是正样本的概率;
(2)根据概率从小到大排序;
(3)给每个样本一个属性RRR,RRR表示概率小于该样本的样本个数+1。
比如共100个样本,某个样本的概率最高,为0.99,则这个样本的R=100R=100R=100。RRR同时等于排序后样本的索引+1。
(4)对于概率最大的正样本,RRR等于概率小于该样本的正负样本个数之和+1,其中正样本个数为M−1M-1M−1,则负样本个数为R1−(M−1)−1=R1−MR_1-(M-1)-1=R_1-MR1−(M−1)−1=R1−M。
对于概率次大的正样本,RRR等于概率小于该样本的正负样本个数之和+1,其中正样本个数为M−2M-2M−2,则负样本个数为R2−(M−2)−1=R2−(M−1)R_2-(M-2)-1=R_2-(M-1)R2−(M−2)−1=R2−(M−1)。
依次类推,考虑AUC的含义为正样本的概率大于负样本的概率的组数之和,再除以M∗NM*NM∗N。则正样本的概率大于负样本的概率的组数之和,等于[R1−M]+[R2−(M−1)]+[R3−(M−2)]+...+[Rm−(1)][R_1-M]+[R_2-(M-1)]+[R_3-(M-2)]+...+[R_m-(1)][R1−M]+[R2−(M−1)]+[R3−(M−2)]+...+[Rm−(1)]。
根据求和公式:1+2+..+M=M∗(1+M)/21+2+..+M=M*(1+M)/21+2+..+M=M∗(1+M)/2,
AUC=[sum(Ri)+M∗(1+M)/2]/M∗NAUC=[sum(R_i)+M*(1+M)/2]/M*NAUC=[sum(Ri)+M∗(1+M)/2]/M∗N。
(5)当正负样本的概率相等时,该正样本的RiR_iRi等于所有和其概率相等的RRR的均值。
本文详细解析了如何计算AUC(Area Under the Curve),通过两种方法阐述了正负样本概率对比的过程。首先介绍了基础的二分类器预测组合比较方法,然后变形为概率排序并计算累计优势的方法。通过概率排序,每个样本获得一个排名属性RRR,正样本的概率大于负样本的组数可以通过RRR的累加和求得,进一步推导出AUC的公式。当概率相等时,RRR取平均值。这种方法有助于深入理解AUC的统计意义。

5892

被折叠的 条评论
为什么被折叠?



