LSNet: See Large, Focus Small
记录一些新出的深度学习网络结构,这是一个backbone,作者说可以用于多种视觉任务。
LSNet(Large-Small Network)是一种新型的轻量级视觉网络,旨在通过高效的感知和聚合策略实现高性能与低计算成本的平衡。它受到人类视觉系统“看大,聚焦小”策略的启发,提出了一种结合大核感知(Large-Kernel Perception, LKP)和小核聚合(Small-Kernel Aggregation, SKA)的LS卷积操作。通过这种独特的设计,LSNet能够高效地捕获广泛的上下文信息,并对小范围内的特征进行精细聚合,从而在多种视觉任务中展现出卓越的性能和效率。
背景与挑战
卷积神经网络 (CNNs) 和 Vision Transformers 等视觉网络设计极大地推动了计算机视觉领域的发展。然而,它们的复杂计算给实际部署带来了挑战,特别是在需要实时处理的应用中。为了解决这个问题,研究人员一直在探索各种轻量级和高效的网络设计。
现有方法的局限性
现有的轻量级模型主要依赖于自注意力机制和卷积进行特征混合。这种依赖性在轻量级网络的感知和聚合过程中存在有效性和效率的局限性,从而在有限的计算预算下,难以平衡性能与效率。
“先看大局,再关注细节”策略与LS卷积
在这篇论文中,研究人员从人类视觉系统固有的高效动态异尺度视觉能力中汲取灵感,提出了一种名为**“先看大局,再关注细节” (“See Large, Focus Small”)** 的轻量级视觉网络设计策略。
他们引入了 LS (Large-Small) 卷积,它结合了大核感知和小核聚合。这种设计能够高效地捕获大范围的感知信息,并对动态复杂的视觉表示实现精确的特征聚合,从而有效地处理视觉信息。基于LS卷积,研究人员提出了一个名为 LSNet 的新轻量级模型家族。
Methodology
3.1 重新审视自注意力与卷积
自注意力(Self-attention)和卷积(Convolution)是当前轻量化网络中两种主要的 token 混合方式,用于建模视觉特征。对于输入图像,其特征图记作 X ∈ R H × W × C X \in \mathbb{R}^{H \times W \times C} X∈RH×W×C,其中 H × W H \times W H×W 是空间分辨率, C C C 是通道数。Token 混合的目标是:对每个 token x i ∈ R C x_i \in \mathbb{R}^C xi∈RC,基于其上下文区域 N ( x i ) \mathcal{N}(x_i) N(xi) 生成对应的特征表示 y i ∈ R C y_i \in \mathbb{R}^C yi∈RC:
y i = A ( P ( x i , N ( x i ) ) , N ( x i ) ) (1) y_i = \mathcal{A}(\mathcal{P}(x_i, \mathcal{N}(x_i)), \mathcal{N}(x_i)) \tag{1} yi=A(P(xi,N(xi)),N(xi))(1)
其中, P \mathcal{P} P 表示感知(Perception),用于提取上下文信息并捕捉 token 之间的关系;而 A \mathcal{A} A 表示聚合(Aggregation),它基于感知结果整合特征,从而实现信息的融合。

自注意力
在自注意力机制中,其感知过程 P a t t n \mathcal{P}_{attn} Pattn 通过计算 x i x_i xi 与整个特征图 X X X 的逐对相关性,得到注意力分数,并经过 softmax 归一化;随后聚合过程 A a t t n \mathcal{A}_{attn} Aattn 以这些分数为权重,对 X X X 的特征进行加权求和,得到输出 y i y_i yi。如图2(a)所示,该过程可表示为:
y i = A a t t n ( P a t t n ( x i , X ) , X ) = P a t t n ( x i , X ) ⋅ ( X W v ) (2) y_i = \mathcal{A}_{attn}(\mathcal{P}_{attn}(x_i, X), X) = \mathcal{P}_{attn}(x_i, X) \cdot (XW_v) \tag{2} yi=Aattn(Pattn(xi,X),X)=Pattn(xi,X)⋅(XWv)(2)
P a t t n ( x i , X ) = softmax ( ( x i W q ) ( X W k ) T ) (3) \mathcal{P}_{attn}(x_i, X) = \text{softmax}((x_iW_q)(XW_k)^T) \tag{3} Pattn(xi,X)=softmax((xiWq)(XWk)


1646

被折叠的 条评论
为什么被折叠?



