1. 【前言】
如今各种视觉网络设计,包括卷积神经网络(Convolutional Neural Network)和视觉Transformer(Vision Transformer),都已经在计算机视觉领域取得了显著成效。但是这些网络中复杂的计算过程,又让我们难以进行实地部署,为实时应用造成困难。
研究人员试图从将模型轻量化或设计更高效的神经网络结构上入手解决上述问题,然而现有的模型在进行token混合时主要利用自注意力机制和卷积计算相结合,在轻量级网络中会造成性能上的限制,无法达到预算与实际效率间的最优平衡。
为此,来自CVRP2025的论文《LSNet: See Large, Focus Small》从人类的视觉系统中获得启发,基于人类可以捕捉大视场全景信息并将注意力引导至场景中特定小元素上的特点,提出了LS(Large-Small)卷积,通过大核感知(large-kernel perception)和小核聚合(small-kernel aggregation),在高效捕捉大范围视觉信息特征的同时,实现对动态、复杂的视觉特征的精确融合。基于LS卷积,论文中提出了一种轻量级模型LSNet,在多个领域上取得了卓越的性能。

2.【论文基本信息】

- 论文标题:LSBNet: See Large, Focus Small
- 论文链接:https://arxiv.org/pdf/2503.23135
3.【创新点概述】
3.1 LS 卷积: 受人眼视觉系统机制启发的多尺度卷积
人眼视觉系统在捕获大场景信息的同时,通过聚焦的方式,将注意力引导集中在场景中的特定物体信息上,实现在接受大范围视觉信息特征的同时,可以利用聚焦的方式实现注意力的引导和集中。基于上述特点,本文提出了LS卷积,利用大尺寸深度卷积核感知(Large Kernel Perception, LKP)提取全局上下文信息,利用小尺寸核聚合(Small Kernel Aggregation, SKA),在局部区域内对信息进行精确融合。
3.2 轻量视觉网络LSNet
基于LS卷积,本文提出了轻量级网络LSNet。LSNet网络由包含LS卷积和前向反馈网络FFN的LS卷积层、 下采样层和多头注意力层等结构组成,与其他轻量级视觉网络相比,在多个任务上具有较强竞争力。
4.【整体架构流程】

4.1 Large Kernel Perception (LKP)大尺寸核感知
对与输入特征图 X ∈ R H × W × C X \in \mathbb{R}^{H \times W \times C} X∈RH×W×C,分别进行逐点卷积操作(point-wise convolution, PW)和大尺寸核深度卷积(large-kernel depth-wise convolution, DW),在降低特征空间维度、减少计算消耗的同时,充分提取像素点与周围位置间的特征信息关联,实现对大尺度范围特征的提取。利用上述操作,LKP层可以为输入特征图中的每个像素点 x i x_i xi赋予特定权重值 w i w_i wi,权重矩阵 W W W中包含了像素点的特征信息程度,并为后续对局部特征进行重点关注的SKA操作提供重要输入指标。 w i w_i w


1841

被折叠的 条评论
为什么被折叠?



