基于树结构索引的增量分区图相似性搜索算法解析
1. 背景与现有算法分析
在图相似性搜索领域,现有的一些算法在处理大规模图数据库时存在一定的局限性。例如,Pars采用随机图分区策略,提出了非重叠且可变大小的图分区方法;ML_index则利用顶点和边标签频率来定义分区,提出了选择性图分区算法以提高过滤性能。然而,这两种算法都以图作为索引特征,创建大规模图的索引成本较高。
2. IP - Tree算法核心内容
2.1 基于分区的过滤方案
在大规模图数据库中,精确计算每个图与查询图的图编辑距离(GED)成本极高。因此,采用过滤和验证框架,在精确计算GED之前,使用分区方法计算候选图与查询图之间的GED下界,从而过滤候选集,降低精确计算GED的成本。
- 诱导子图同构定义 :给定图G1和G2,若存在映射f : VG1 → VG2满足特定条件,则称G1是G2的诱导子图同构,记为G1 ⊆ G2。
- 图划分定义 :图G的划分P(G) = {p1, …, pk},其中pk需满足一定条件,如每个分区是G的子图、分区之间顶点集不相交且所有分区顶点集的并集等于G的顶点集。
- 分区匹配定义 :给定图G1和G2,分区p ∈ P(G1),若p ⊆ G2,则p是G2的匹配分区,否则为不匹配分区。
- 引理与推论 :给定图G1和G2以及G1的分区P(G1),lb(G1, G2) = |{p | p ∈ P(G1) ∧ p ⊈ G2}|是GED(G1, G2)的下界。若lb(G1, G2) &g
超级会员免费看
订阅专栏 解锁全文

1427

被折叠的 条评论
为什么被折叠?



