视频社交关系识别的整体-独特图卷积网络
1. 相关工作
近年来,视觉内容中的社交关系识别受到了广泛关注。现有工作主要集中在静态图像上。之前的研究为此任务收集了两个大型数据集,分别是“相册中的人物”(PIPA)和“社交情境中的人物”(PISC)。然而,静态图像总是同时包含所有人物对,而人物可能出现在视频的任何帧中,所以该任务与我们要解决的问题存在一些差异。
也有一些研究尝试从视频中识别社交关系,其中大多数构建并利用人物图来推断关系。例如:
- Wu等人提出了HC - GCN框架,用于生成帧级图,并沿着时间轨迹进一步聚合这些图。
- Teng等人构建了一个人物和关系推理图,结合视频上下文信息进行社交关系推理。
- Yan等人设计了三种三元组的表示方法,以构建关系知识图,并关联情境信息进行关系预测和识别。
- Liu等人提出了VTF框架,将多模态信息集成到一个表示模型中,用于多关系提取。
但这些方法都没有在关注每个特定人物对特殊性的同时,把握整体人物的联系,这与我们的方法不同。
2. 方法概述
我们的整体 - 独特图卷积网络(Overall - Distinctive GCN,OD - GCN)框架主要包含两部分:
- 整体级人物GCN :我们认为视频中的其他人物也会对特定人物对的关系识别产生影响。为了捕捉人物的整体联系,我们构建了一个具有两种不同类型边的异构图。该图的节点是所有人物的出现实体,然后利用GCN传播每个人物的表示。
- 独特级人物GCN :由两个模块组成。对于某个人物对,我们试图找到与识别关系最
超级会员免费看
订阅专栏 解锁全文

306

被折叠的 条评论
为什么被折叠?



