
文章地址:2203.16768.pdf (arxiv.org)
个人阅读见解,欢迎大家交流讨论指正~
一、研究背景
虽然近些年语义分割有了很大的进步,但是应用到现实世界下游任务还是有局限,无法处理未定义类别。基于文本的实例分割(Referring image segmentation) 就是作者为了解决此问题而提出的任务,Referring image segmentation是一个目标类别没有预定义但在自然语言被描述的前沿的图像分割任务,通过一段自然语言表述(query)分割出实例。这个任务在人机交互、照片编辑等场景广泛应用。
![[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-Eq1ywrfa-1650878392324)(C:\Users\Tycoon\AppData\Roaming\Typora\typora-user-images\image-20220423140858454.png)]](/https://i-blog.csdnimg.cn/blog_migrate/f935c71c7c4fae4a2170fcf1cb52d5b8.png)
二、相关工作
语义分割:FCN,CNN。但是只能对预先定义类别进行分割。
基于文本的实例分割:CNN,RNN,ConvLSTM。卷积很难获取语言表达中实体之间的长期依赖关系,并且不够灵活,无法对两种不同模式之间的交互进行建模。
Vision Transformer:对原始图片进行分块,展平成序列,输入进原始Transformer模型的编码器Encoder部分,最后接入一个全连接层对图片进行分类。

三、ReSTR
为了捕捉每个模态的远程交互,ReSTR首先通过Transformer Encoder(Fig.2.a)独立地提取视觉和语言特征。然后,它将视觉和语言特征平行输入到多模融合编码器(Fig.2.b),以捕捉这两种模态之间的细微关系。最后,用于从粗到细分割的高效解码器(Fig.2.c) 将patch-level预测转换为高分辨pixel-level预测。
![[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-5yz9309T-1650878392326)(C:\Users\Tycoon\AppData\Roaming\Typora\typora-user-images\image-20220424094323279.png)]](/https://i-blog.csdnimg.cn/blog_migrate/266f2beaf5508ab9ede63c7da24a1db8.png)
3.1视觉和语言特征提取
Transformer encoder由M个连续的Transformer组成,每个Transformer由Multi-headed Self-Attention (MSA), Layer Normalization (LN), and Multilayer Perceptron (MLP) blocks组成,公式为:
z ‾ i + 1 = MSA ( LN ( z i ) ) + z i z i + 1 = MLP ( LN ( z ‾ i + 1 ) ) + z ‾ i + 1 其中, Z i 是 i 层 t r a n s f o r m e r 的输出 \begin{gathered} \overline{\mathbf{z}}_{i+1}=\operatorname{MSA}\left(\operatorname{LN}\left(\mathbf{z}_{i}\right)\right)+\mathbf{z}_{i} \\ \mathbf{z}_{i+1}=\operatorname{MLP}\left(\operatorname{LN}\left(\overline{\mathbf{z}}_{i+1}\right)\right)+\overline{\mathbf{z}}_{i+1} \end{gathered}\\ 其中,\mathbf{Z}_{i}是i层transformer的输出 zi+1=MSA(LN(zi))+zizi+1=MLP(LN(zi+1))+zi+1其中,Zi是i层transformer的输出
MSA由k个 Self-Attention (SA) 组成,公式为:
MSA ( z ) = [ S A 1 ( z ) , S A 1 ( z ) , ⋯ , S A k ( z ) ] W M S A SA ( z ) = A v A = softmax ( q k ⊤ / D h ) 其中, W M S A 是一个线性映射 \begin{gathered} \operatorname{MSA}(\mathbf{z})=\left[\mathrm{SA}_{1}(\mathbf{z}), \mathrm{SA}_{1}(\mathbf{z}), \cdots, \mathrm{SA}_{k}(\mathbf{z})\right] \mathbf{W}_{\mathrm{MSA}} \\ \operatorname{SA}(\mathbf{z})=A \mathbf{v} \\ A=\operatorname{softmax}\left(\mathbf{q k}^{\top} / \sqrt{D_{h}}\right) \end{gathered} 其中,\mathrm{W}_{MSA}是一个线性映射 MSA(z)=[SA1(z),SA1(z),⋯,SAk(z)]WMSASA(z)=AvA=softmax(qk⊤/Dh)其中,WMSA是一个线性映射
作者分别用Transformer提取Vision和Language特征:
Vision encoder: 采用了ViT的思想,将图片分成P×P个小patches加上位置编码输入到Transformers,得到输出。
![[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-fBnSores-1650878392326)(C:\Users\Tycoon\AppData\Roaming\Typora\typora-user-images\image-20220424105721644.png)]](/https://i-blog.csdnimg.cn/blog_migrate/83b8cba6cd70962c528ca9fe45308b75.png#pic_center)
Language encoder: 将 word embeddings加上位置编码,输入到Transformers。

上述提到的Vision encoder和Language encoder都利用了Transformer encoder,并没做出改进,可以说是本文中的别名。
3.2多模融合编码器
由两个Transformer encoder构成(visual-linguistic encoder and linguistic-seed encoder)

本文介绍了一种名为ReSTR的新型模型,用于解决基于文本的实例分割任务,该任务旨在处理未定义类别的分割。ReSTR结合Transformer编码器独立提取视觉和语言特征,通过多模融合编码器捕捉两种模态间的交互,再由高效的分割解码器生成像素级预测。实验显示ReSTR在多个数据集上表现出色,特别是在理解和捕捉语言表达的精细关系方面。

1214

被折叠的 条评论
为什么被折叠?



