【论文阅读笔记】CVPR 2025 | 清华团队打造轻量级网络新范式:LSNet 2025.3.29 | 模型小巧却更精确 | See Large, Focus Small

目录

【摘要】

【轻量视觉网络LSNet】

Large Kernel Perception (LKP)大尺寸核感知

Small Kernel Aggrgation(SKA)小尺寸核聚合

【实验结果】

【结论】



论文题目LSNet: See Large, Focus Small

论文地址https://arxiv.org/pdf/2503.23135

代码地址https://github.com/THU-MIG/lsnet

摘要

视觉网络设计包括卷积神经网络和视觉转换器,极大地推动了计算机视觉领域的发展。然而,它们的复杂计算为实际部署带来了挑战,特别是在实时应用中。为了解决这个问题,研究人员探索了各种轻量级和高效的网络设计。然而,现有的轻量级模型主要利用自注意力机制和卷积进行令牌混合。这种依赖关系在轻量级网络的感知和聚合过程中带来了有效性和效率上的限制,阻碍了有限计算预算下性能和效率之间的平衡。在本文中,从高效的人类视觉系统中固有的动态异尺度视觉能力中得到启发,提出了"See Large, Focus Small"的轻量级视觉网络设计策略引入LS (Large-Small)卷积,它结合了大核感知和小核聚合。它可以高效地捕获大范围的感知信息,并对动态复杂的视觉表征实现精确的特征聚合,从而实现对视觉信息的精通处理在LS卷积的基础上,提出了LSNet,一种新的轻量级模型。大量实验表明,LSNet在各种视觉任务中取得了优于现有轻量级网络的性能和效率。

总的来说,贡献有以下三个方面:

  1. 倡导在人类视觉系统的启发下,采用"大处着眼,小处着眼"的新策略,进行轻量化、高效化的网络设计。通过包含广泛的感知范围和丰富的上下文信息,它有助于集中的特征聚合,从而促进详细的视觉理解。
  2. 提出LS卷积作为一种新颖的操作,用于在轻量级模型中对视觉特征进行建模。LS卷积融合了大核感知和小核聚合,通过有效和高效的感知和聚合过程,实现了对视觉信息的精通处理。
  3. 提出了一个新的轻量级视觉网络家族,即LSNet,它建立在LS卷积的基础上。大量实验表明,与其他轻量级网络相比,LSNet在广泛的视觉任务中实现了最先进的性能和效率权衡。

【轻量视觉网络LSNet】

图1。自我注意( a )和卷积( b )的机制。( c )表示人类视觉系统可以通过边缘视觉"看大",通过中心视觉"聚焦小"。( d )显示了视杆和视锥的分布依赖于离人眼中心凹的偏心率。它们有助于形成广泛的周边视野和局灶的中心视野。

图2。对比自注意力、卷积和LS转换组注意力,有效提升能力。

图3。( a )提出的LS卷积的说明。( b )提出的LSNet的说明。

Large Kernel Perception (LKP)大尺寸核感知

Large-Kernel Perception(LKP)模块的核心设计是通过大核深度卷积高效捕获长距离空间上下文。

1. 通道压缩:点卷积降维(PW)

  • 输入:特征图 

  • 操作:使用 1×1 卷积(Point-wise Conv)将通道数压缩至 C/2

  • 目的:减少后续计算量,公式如下:


2. 大核感受野扩展:深度卷积(DW)

  • 操作:在 ​上执行 深度卷积(Depth-wise Conv),卷积核尺寸 ),典型值

  • 数学表达:对每个位置 xi​ 聚合其邻域 

  • 效果

    • ✅ 单层即可覆盖 961倍像素面积(31×31),远超小卷积堆叠

    • ✅ 计算量优化


3. 空间关系建模:点卷积升维(PW)

  • 输入:深度卷积输出

  • 操作:再次使用 1×1 卷积将通道数恢复至 D

  • 关键作用

    🌟 此处 W 是空间自适应权重,为每个位置生成独特的通道注意力向量


4. 上下文聚合:权重融合

  • 输出构建:将权重 W 与原始特征 X逐点相乘:

  • 物理意义

    • W的每个位置编码了 xi周围 区域的上下文信息

    • 通过通道加权,动态增强与全局上下文相关的特征通道

Small Kernel Aggrgation(SKA)小尺寸核聚合

 SKA 旨在利用 LKP 模块提供的大范围上下文信息(全局理解),以一种轻量且动态的方式,对局部细节进行精细化的特征聚合。它要解决的核心问题是:如何在保持模型轻量化的同时,让模型能根据图像不同区域的内容自适应地关注最重要的局部信息。

关键设计: 分组动态卷积。这包含了两个核心概念:

  1. 分组 (Grouped):为了减少计算量和内存占用。

  2. 动态 (Dynamic):卷积核权重不是固定不变的,而是由 LKP 模块根据输入图像的全局上下文动态生成的。这使得模型能针对不同的图像区域“定制”不同的聚合方式。

1. 通道分组:轻量化基础

  • 输入:特征图 

  • 操作:将通道均分为 G 组,每组含 C/G​ 通道

  • 目的

    • 组内通道共享聚合权重,显著降低参数量

    • 计算量从

  • 数学表达


2. 权重重塑:动态卷积核生成

  • 输入:LKP 模块输出的自适应权重

  • 操作:将每个位置的权重向量 重塑为三维张量:

  • 物理意义

    • 包含 G个卷积核(每组一个)

    • 每个卷积核尺寸为


3. 分组动态卷积:细粒度特征聚合

  • 操作:对位置 xi的邻域执行组内卷积

  • 数学过程
    属于第 g组:

  • 输出

🌟 核心创新

  • 权重 ​ 动态生成(来自LKP的大上下文感知)

  • 卷积核按组共享,平衡细粒度与效率

SKA详细解释

假设输入特征图 X 的维度是 H x W x C (高度 x 宽度 x 通道数)。

  1. 通道分组 (Channel Grouping - 为了轻量化):

    将 C 个通道平均分成 G 组。

    每组包含 C_g = C / G 个通道。

    为什么这样做? 传统动态卷积需要为 C 个通道 每个位置 都生成一个 K_S x K_S 的卷积核,这会产生巨大的参数和计算量 (H * W * C * K_S * K_S)

    SKA 的巧思 让同一组内的所有通道共享同一个卷积核权重!这样,每个位置只需要生成 G 个 K_S x K_S 的卷积核,而不是 C 个。参数和计算量瞬间降低到 (H * W * G * K_S * K_S)。因为 G 通常远小于 C (例如 C=512G=32),节省非常显著 (32 / 512 = 1/16)。

  2. 权重重塑 (Weight Reshaping - 连接 LKP 与 SKA):

    输入:LKP 模块的输出是权重张量 W ∈ H x W x D。通常 D = C (与输入通道数相同)。这个张量 W 的每个空间位置 (h, w) 上都有一个长度为 D (= C) 的向量 w_i。这个向量编码了 LKP 大核在该位置感知到的全局上下文信息

    操作:对于特征图 X 上每个位置 i (即每个 (h, w)),取出对应的权重向量 w_i ∈ R^D (= R^C)。

    重塑:将这个一维向量 w_i (形状 [C]重塑 (reshape) 成一个三维张量 w*_i ∈ R^{G x K_S x K_S}

    G:分组数;

    K_S x K_S:小卷积核的大小 (例如 5x5)

    物理意义 这个重塑操作将 LKP 提供的 全局上下文编码向量 w_i,转换成了 G 个 局部聚合用的卷积核 w*_ig (每个 g 对应一个组)。每个 w*_ig 就是一个 K_S x K_S 的小卷积核。w*_i 可以看作是一个包含 G 个卷积核的“核包”。

  3. 分组动态卷积 (Grouped Dynamic Convolution - 执行局部精细聚合):

    • 目的:利用上一步生成的、与位置 i 相关的动态卷积核 w*_i,对位置 i 周围的一个小邻域 N_{K_S}(x_i) (大小为 K_S x K_S) 进行卷积操作,得到该位置最终的聚合特征表示 y_i

    • 操作细节:

      • 对于特征图 X 上的每一个位置 i

      • 对于每一个通道 c ( c = 0, 1, ..., C-1 ):

        • 确定这个通道 c 属于哪个组 g (因为通道被分成了 G 组,所以每个 c 必然属于且只属于一个组 g)。

        • 取出该位置 i 的动态卷积核包 w*_i 中,对应组 g 的那个卷积核 w*_{ig} ∈ R^{K_S x K_S}

        • 以位置 i 为中心,取出 X 上大小为 K_S x K_S 的邻域块 N_{K_S}(x_i^c)。注意,这里只取通道 c 上的邻域值,这是一个单通道的 K_S x K_S 块。

        • 执行单通道卷积:将卷积核 w*_{ig} 作用在邻域块 N_{K_S}(x_i^c) 上。

          • y_i^c = w*_{ig} ⊛ N_{K_S}(x_i^c)

          •  表示卷积操作 (求和:核权重乘以邻域对应位置的像素值再相加)。

      • 这样,位置 i 的第 c 个通道的输出值 y_i^c 就计算出来了。

关键点:

  • 信息融合 这个局部聚合的权重 w*_{ig} 是由 LKP 的大范围上下文 (31x31 或更大) 决定的!这就是“大核指导小核”的精髓。全局理解指导了局部应该如何聚合。

  • 局部性 聚合操作只发生在很小的 K_S x K_S (如 5x5) 邻域内,专注于提取精细的局部特征 (如边缘、角点、小纹理)。

  • 分组共享 组 g 内的所有通道 c (例如 16 个通道) 共享同一个卷积核 w*_{ig}。这大大降低了参数量和计算量,是轻量化的关键。

  • 动态性 卷积核 w*_{ig} 随着位置 i 的变化而变化!位置 i 不同,LKP 提供的全局上下文不同,生成的卷积核也不同。这使得模型在图像的不同区域(如平滑背景 vs. 物体边缘 vs. 纹理区域)能采用不同的聚合策略

输出: 对所有位置 i 和所有通道 c 执行完上述操作后,就得到了输出特征图 Y ∈ H x W x C

总而言之,SKA 的核心价值在于 它巧妙地利用分组机制实现了轻量化,同时通过动态生成由全局上下文指导的卷积核,实现了对局部特征的精细化、自适应聚合,显著提升了模型对复杂视觉内容的感知能力。它是连接 LKP 全局理解和最终精细特征表达的关键桥梁。

【实验结果】

图5。LS卷积中聚合权重的可视化。第二行表明聚合权重与语义相关区域具有较好的相关性。第三行表明,集成LKP使LS卷积能够捕获更精确的视觉模式,并改善上下文信息。

图6。LKP和SKA特征图的可视化。每个部分的第二列显示LKP可以包含场景的广阔视野。每个部分的第三列表明,在LKP的基础上,SKA可以进一步掌握更细微的特征和详细的模式。

图7。在COCO - 2017上进行目标检测和实例分割的定性结果[ 49 ]。

图8。关于ADE20K的语义分割的定性结果[ 106 ]。上行列表示真实的掩码,下行列表示预测的掩码。

表1。在ImageNet-1K上的分类结果。

表2。COCO上的目标检测和实例分割结果。

表3。在ADE20K上进行语义分割。

表4。在基准数据集上的鲁棒性评估结果

【结论】

在这项工作中,提出了LSNet,这是一个新的轻量级视觉网络家族,它集成了人类视觉系统的"见大,焦点小"策略。LSNet融合了LS卷积,一种结合了大核感知和小核心聚合的新操作,实现了对视觉信息的高效准确处理。大量实验表明,LSNet取得了最先进的性能和效率折衷。它在不同的任务中表现出相对于其他任务的优越性。希望LSNet可以作为一个强有力的基准,并激励在开发轻量级和高效的视觉网络方面取得进一步的进展。

至此,本文的内容就结束了。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Jackilina_Stone

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值