聚类有效性——最佳聚类数

本文介绍了聚类有效性的内部指标,特别是Calinski-Harabasz(CH)和Davies-Bouldin(DB)指标,用于确定数据集的最佳聚类数。CH指标衡量类内离差与类间离差的比例,DB指标则通过比较类内散度和类间距离来评估。通过在Matlab中应用这些指标,结合k-means算法,可以找到最大化这些指标值的最优聚类数。

聚类有效性的评价标准有两种:一是外部标准,通过测量聚类结果和参考标准的一致性来评价聚类结果的优良;另一种是内部指标,用于评价同一聚类算法在不同聚类数条件下聚类结果的优良程度,通常用来确定数据集的最佳聚类数。
一 最佳聚类数判定的方法
对于内部指标,通常分为三种类型:基于数据集模糊划分的指标;基于数据集样本几何结构的指标;基于数据集统计信息的指标。基于数据集样本几何结构的指标根据数据集本身和聚类结果的统计特征对聚类结果进行评估,并根据聚类结果的优劣选取最佳聚类数,这些指标有Calinski-Harabasz(CH)指标,Davies-Bouldin(DB)指标Weighted inter-intra(Wint)指标,Krzanowski-Lai(KL)指标,Hartigan(Hart)指标,In-Group Proportion(IGP)指标等。本文主要介绍Calinski-Harabasz(CH)指标和Davies-Bouldin(DB)指标。
(1) CH指标
CH指标通过类内离差矩阵描述紧密度,类间离差矩阵描述分离度,指标定义为
这里写图片描述

其中,n表示聚类的数目 ,k 表示当前的类, trB(k)表示类间离差矩阵的迹, trW(k) 表示类内离差矩阵的迹。有关公式更详细的解释可参考论文“ A dendrite method for cluster analysis ”。
可以得出 CH越大代表着类自身越紧密,类与类之间越分散,即更优的聚类结果。

(2) DB指标
DB指标通过描述样本的类内散度与各聚类中心的间距,定义为
这里写图片描述
其中,K是聚类数目,Wi表示类Ci中的所有样本到其聚类中心的平均距离,Wj表示类Ci中的所有样本到类Cj中心的平均距离,Cij表示类Ci和Cj中心之间的距离。可以看出,DB越小表示类与类

评论 9
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值