1. 持久同调与对抗鲁棒性:拓扑数据分析的新视角
在数据分析领域,我们常常需要从复杂的数据集中提取有意义的特征。传统方法主要关注数据的几何或统计特性,而拓扑数据分析(Topological Data Analysis, TDA)则提供了一种全新的视角——研究数据的"形状"特征。持久同调(Persistent Homology)作为TDA的核心工具,能够捕捉数据在不同尺度下的拓扑结构变化。
想象一下,当你观察一片星云时,近距离看可能只看到离散的星点,但随着视野扩大,这些点开始形成某种图案或结构。持久同调的工作方式与此类似——它通过构建一系列嵌套的"网状结构"(数学上称为单纯复形)来捕捉数据在不同"分辨率"下的拓扑特征。这些特征可能是数据中的"洞"(高维空洞)、"环"或"连接成分"等。
然而,这种方法有一个明显的弱点:对异常值(outliers)过于敏感。就像一张蜘蛛网,即使只破坏一两根丝线,整个网的结构可能就会发生显著变化。这种敏感性限制了持久同调在现实场景中的应用,因为现实数据往往包含噪声和异常值。
1.1 持久同调的基本原理
要理解对抗鲁棒性,我们需要先掌握持久同调的基本工作机制。整个过程可以分为三个关键步骤:
-
过滤构建 :从数据点出发,逐步扩大"连接半径"ε,构建一系列嵌套的单纯复形K₀⊆K₁⊆...⊆Kₙ。最常用的Vietoris-Rips复形定义如下:当数据点间的距离≤ε时,它们之间就形成一条边;当三个点两两距离都≤ε时,就形成一个三角形,以此类推。
-
同调计算 :在每个尺度ε下,计算复形的同调群Hₖ(Kᵢ),这可以捕捉k维的拓扑特征(如连通分量、环、空洞等)。
-
条形码生成 :跟踪这些拓扑特征的"生命周期"——它们何时出现(birth)和消失(death),最终形成一组区间[bᵢ,dᵢ)的集合,称为条形码。
关键概念 <


446


被折叠的 条评论
为什么被折叠?



