[CVPR2022|基于文本实例分割]ReSTR: Convolution-free Referring Image Segmentation Using Transformers

本文介绍了一种名为ReSTR的新型模型,用于解决基于文本的实例分割任务,该任务旨在处理未定义类别的分割。ReSTR结合Transformer编码器独立提取视觉和语言特征,通过多模融合编码器捕捉两种模态间的交互,再由高效的分割解码器生成像素级预测。实验显示ReSTR在多个数据集上表现出色,特别是在理解和捕捉语言表达的精细关系方面。

在这里插入图片描述

文章地址:2203.16768.pdf (arxiv.org)

个人阅读见解,欢迎大家交流讨论指正~

一、研究背景

虽然近些年语义分割有了很大的进步,但是应用到现实世界下游任务还是有局限,无法处理未定义类别。基于文本的实例分割(Referring image segmentation) 就是作者为了解决此问题而提出的任务,Referring image segmentation是一个目标类别没有预定义但在自然语言被描述的前沿的图像分割任务,通过一段自然语言表述(query)分割出实例。这个任务在人机交互、照片编辑等场景广泛应用。

[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-Eq1ywrfa-1650878392324)(C:\Users\Tycoon\AppData\Roaming\Typora\typora-user-images\image-20220423140858454.png)]

二、相关工作

语义分割:FCN,CNN。但是只能对预先定义类别进行分割。

基于文本的实例分割:CNN,RNN,ConvLSTM。卷积很难获取语言表达中实体之间的长期依赖关系,并且不够灵活,无法对两种不同模式之间的交互进行建模。

Vision Transformer:对原始图片进行分块,展平成序列,输入进原始Transformer模型的编码器Encoder部分,最后接入一个全连接层对图片进行分类。

Vision Transformer整体架构

三、ReSTR

为了捕捉每个模态的远程交互,ReSTR首先通过Transformer Encoder(Fig.2.a)独立地提取视觉和语言特征。然后,它将视觉和语言特征平行输入到多模融合编码器(Fig.2.b),以捕捉这两种模态之间的细微关系。最后,用于从粗到细分割的高效解码器(Fig.2.c) 将patch-level预测转换为高分辨pixel-level预测。

[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-5yz9309T-1650878392326)(C:\Users\Tycoon\AppData\Roaming\Typora\typora-user-images\image-20220424094323279.png)]

3.1视觉和语言特征提取

Transformer encoder由M个连续的Transformer组成,每个Transformer由Multi-headed Self-Attention (MSA), Layer Normalization (LN), and Multilayer Perceptron (MLP) blocks组成,公式为:
z ‾ i + 1 = MSA ⁡ ( LN ⁡ ( z i ) ) + z i z i + 1 = MLP ⁡ ( LN ⁡ ( z ‾ i + 1 ) ) + z ‾ i + 1 其中, Z i 是 i 层 t r a n s f o r m e r 的输出 \begin{gathered} \overline{\mathbf{z}}_{i+1}=\operatorname{MSA}\left(\operatorname{LN}\left(\mathbf{z}_{i}\right)\right)+\mathbf{z}_{i} \\ \mathbf{z}_{i+1}=\operatorname{MLP}\left(\operatorname{LN}\left(\overline{\mathbf{z}}_{i+1}\right)\right)+\overline{\mathbf{z}}_{i+1} \end{gathered}\\ 其中,\mathbf{Z}_{i}是i层transformer的输出 zi+1=MSA(LN(zi))+zizi+1=MLP(LN(zi+1))+zi+1其中,Ziitransformer的输出

MSA由k个 Self-Attention (SA) 组成,公式为:

MSA ⁡ ( z ) = [ S A 1 ( z ) , S A 1 ( z ) , ⋯   , S A k ( z ) ] W M S A SA ⁡ ( z ) = A v A = softmax ⁡ ( q k ⊤ / D h ) 其中, W M S A 是一个线性映射 \begin{gathered} \operatorname{MSA}(\mathbf{z})=\left[\mathrm{SA}_{1}(\mathbf{z}), \mathrm{SA}_{1}(\mathbf{z}), \cdots, \mathrm{SA}_{k}(\mathbf{z})\right] \mathbf{W}_{\mathrm{MSA}} \\ \operatorname{SA}(\mathbf{z})=A \mathbf{v} \\ A=\operatorname{softmax}\left(\mathbf{q k}^{\top} / \sqrt{D_{h}}\right) \end{gathered} 其中,\mathrm{W}_{MSA}是一个线性映射 MSA(z)=[SA1(z),SA1(z),,SAk(z)]WMSASA(z)=AvA=softmax(qk/Dh )其中,WMSA是一个线性映射
作者分别用Transformer提取Vision和Language特征:

Vision encoder: 采用了ViT的思想,将图片分成P×P个小patches加上位置编码输入到Transformers,得到输出。

[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-fBnSores-1650878392326)(C:\Users\Tycoon\AppData\Roaming\Typora\typora-user-images\image-20220424105721644.png)]

Language encoder: 将 word embeddings加上位置编码,输入到Transformers。

上述提到的Vision encoder和Language encoder都利用了Transformer encoder,并没做出改进,可以说是本文中的别名。

3.2多模融合编码器

由两个Transformer encoder构成(visual-linguistic encoder and linguistic-seed encoder

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值