聚类有效性的评价标准有两种:一是外部标准,通过测量聚类结果和参考标准的一致性来评价聚类结果的优良;另一种是内部指标,用于评价同一聚类算法在不同聚类数条件下聚类结果的优良程度,通常用来确定数据集的最佳聚类数。
一 最佳聚类数判定的方法
对于内部指标,通常分为三种类型:基于数据集模糊划分的指标;基于数据集样本几何结构的指标;基于数据集统计信息的指标。基于数据集样本几何结构的指标根据数据集本身和聚类结果的统计特征对聚类结果进行评估,并根据聚类结果的优劣选取最佳聚类数,这些指标有Calinski-Harabasz(CH)指标,Davies-Bouldin(DB)指标Weighted inter-intra(Wint)指标,Krzanowski-Lai(KL)指标,Hartigan(Hart)指标,In-Group Proportion(IGP)指标等。本文主要介绍Calinski-Harabasz(CH)指标和Davies-Bouldin(DB)指标。
(1) CH指标
CH指标通过类内离差矩阵描述紧密度,类间离差矩阵描述分离度,指标定义为
其中,n表示聚类的数目 ,k 表示当前的类, trB(k)表示类间离差矩阵的迹, trW(k) 表示类内离差矩阵的迹。有关公式更详细的解释可参考论文“ A dendrite method for cluster analysis ”。
可以得出 CH越大代表着类自身越紧密,类与类之间越分散,即更优的聚类结果。
(2) DB指标
DB指标通过描述样本的类内散度与各聚类中心的间距,定义为
其中,K是聚类数目,Wi表示类Ci中的所有样本到其聚类中心的平均距离,Wj表示类Ci中的所有样本到类Cj中心的平均距离,Cij表示类Ci和Cj中心之间的距离。可以看出,DB越小表示类与类

本文介绍了聚类有效性的内部指标,特别是Calinski-Harabasz(CH)和Davies-Bouldin(DB)指标,用于确定数据集的最佳聚类数。CH指标衡量类内离差与类间离差的比例,DB指标则通过比较类内散度和类间距离来评估。通过在Matlab中应用这些指标,结合k-means算法,可以找到最大化这些指标值的最优聚类数。

1037

被折叠的 条评论
为什么被折叠?



