论文题目:LSNet: See Large, Focus Small(看到大,关注小)
会议:CVPR2025
摘要:包括卷积神经网络和视觉变压器在内的视觉网络设计极大地推动了计算机视觉领域的发展。然而,它们复杂的计算为实际部署带来了挑战,特别是在实时应用程序中。为了解决这个问题,研究人员已经探索了各种轻量级和高效的网络设计。然而,现有的轻量级模型主要利用自注意力机制机制和卷积来进行令牌混合。这种依赖限制了轻量级网络感知和聚合过程的有效性和效率,阻碍了在有限的计算预算下实现性能和效率之间的平衡。本文从高效的人类视觉系统所固有的动态异尺度视觉能力中汲取灵感,提出了一种“大看,小聚焦”的轻量化视觉网络设计策略。我们引入了LS (Large-Small)卷积,它结合了大核感知和小核聚合。它可以高效地捕获广泛的感知信息,并对动态复杂的视觉表征实现精确的特征聚合,从而实现对视觉信息的熟练处理。在LS卷积的基础上,提出了一种新的轻量级模型LSNet。大量的实验表明,LSNet在各种视觉任务中比现有的轻量级网络具有更高的性能和效率。
代码和模型可在https: //github.com/jameslahm/lsnet。
论文概述
这篇发表在 CVPR 2025 的论文由清华大学研究团队提出,标题为 "LSNet: See Large, Focus Small"。该工作从人类视觉系统的动态异尺度视觉能力中获得灵感,为轻量级视觉网络设计提出了创新性的解决方案。
一、研究背景与问题分析
1.1 现有方法的困境

当前轻量级网络主要依赖两种基本模块进行 token 混合:
自注意力机制的局限性:
- ❌ 过度关注问题:对不重要区域(如背景)产生冗余注意力
- ❌ 同尺度约束:感知和聚合使用相同的混合范围
- ❌ 计算开销大:扩展上下文需要付出显著的计算复杂度代价
- ❌ 效率平衡难:在低计算预算下难以同时保证表达能力和推理速度
卷积操作的局限性:
- ⚠️ 感知范围受限:小卷积核导致的有限感受野
- ⚠️ 缺乏适应性:固定的卷积核权重无法适应不同上下文
- ⚠️ 表达能力弱:对于本就能力有限的轻量级网络尤为致命
1.2 核心矛盾
论文深刻指出:感知(Perception)和聚合(Aggregation)是 token 混合的核心过程。
- 感知:建模 token 之间的上下文关系
- 聚合:基于相应关系整合 token 特征
现有方法在这两个过程中的效率和有效性存在本质性限制。
二、创新点详解
2.1 灵感来源:人类视觉系统
论文从人眼视网膜的生理结构中获得灵感:
人类视觉系统采用双步机制:(1) 通过周边视觉的大视野感知首先捕获场景的广泛概览("See Large");(2) 随后,注意力可以被引导到场景的特定元素,通过中央视觉的小视野聚合实现详细理解("Focus Small")。
生理学基础:
- 杆状细胞:广泛分布在视网膜周边,产生相对模糊的图像但光谱响应范围广,支持大视野周边视觉
- 锥状细胞:主要集中在中央凹,密度高,能够捕获精细细节和复杂特征,实现小视野精确成像
这种"看得广,聚焦准"的策略使人类视觉系统能够快速而熟练地处理视觉信息。
2.2 LS(Large-Small)卷积

论文提出的核心操作包含两个关键步骤:
大核感知(Large-Kernel Perception, LKP)
采用大核瓶颈块设计:
输入 X (H×W×C)
↓ PW (降维至 C/2)
↓ DW_{K_L×K_L} (大核深度卷积)
↓ PW (生成权重 W ∈ R^{H×W×D})
↓ 输出聚合权重
设计优势:
- ✅ 使用深度卷积高效扩展感受野(默认 K_L=7)
- ✅ 通过点卷积建模空间关系,生成上下文自适应权重
- ✅ 最小化计算开销的同时获得大范围上下文信息
小核聚合(Small-Kernel Aggregation, SKA)
采用分组动态卷积设计:
特征 X 按通道分为 G 组
↓ 权重 w_i 重塑为 w_i* ∈ R^{G×K_S×K_S}
↓ 对每组使用动态卷积:y_{ic} = w_{ig}* ⊛ N_{K_S}(x_{ic})
↓ 输出精细特征表示
核心思想:
- 🎯 在小范围高度相关区域内进行自适应特征融合
- 🎯 通过分组机制(默认 G=C/8)降低内存和计算开销
- 🎯 使模型对动态和复杂的上下文变化敏感
关键区别: 与简单组合大小核卷积不同,LKP 利用丰富的大域视觉感知来指导 SKA 在高度相关上下文中的自适应特征融合,从而为复杂视觉信息实现更具判别性的表示。
2.3 LSNet 架构

基于 LS 卷积构建完整网络:
LS Block 设计:
- LS 卷积作为主要操作
- 额外的深度卷积和 SE 层增强局部归纳偏置
- 跳跃连接促进优化
- FFN 进行通道混合
整体架构:
- 4 阶段设计:H/8 × W/8, H/16 × W/16, H/32 × W/32, H/64 × W/64
- 前 3 阶段:堆叠 LS Blocks
- 最后阶段:采用 MSA Block 捕获长程依赖
- 重叠补丁嵌入进行输入投影
- 深度+点卷积进行下采样
模型变体:
| 模型 | FLOPs | 参数量 | 定位 |
|---|---|---|---|
| LSNet-T | 0.3G | 11.4M | 超轻量 |
| LSNet-S | 0.5G | 16.1M | 轻量 |
| LSNet-B | 1.3G | 23.2M | 基础 |
2.4 复杂度分析
LS 卷积的计算主要包含三部分:LKP 中的点卷积 O(3HWC²/4 + HWCD/2),LKP 中的大核深度卷积 O(HWCK²_L/2),以及 SKA 中的卷积聚合 O(HWCK²_S)。因此总计算量为 O(HWC/4(3C + 2K²_L + (2G+4)K²_S)),相对于输入分辨率保持线性复杂度。
三、实验结果
3.1 ImageNet-1K 分类

主要结果:
| 模型 | FLOPs | 吞吐量(img/s) | Top-1(%) |
|---|---|---|---|
| LSNet-T | 0.3G | 14708 | 74.9 |
| LSNet-T* | 0.3G | 14708 | 76.1 |
| LSNet-S | 0.5G | 9023 | 77.8 |
| LSNet-S* | 0.5G | 9023 | 79.0 |
| LSNet-B | 1.3G | 3996 | 80.3 |
| LSNet-B* | 1.3G | 3996 | 81.6 |
(*表示使用蒸馏训练)
关键对比:
- 📊 vs AFFNet: LSNet-B 高 0.5% 准确率,推理速度快近 3倍
- 📊 vs RepViT-M1.1: 高 0.9% 准确率且效率更高
- 📊 vs FastViT-T12: 高 1.2% 准确率且吞吐量更大
- 📊 vs EfficientViT-M3: LSNet-T 高 1.5% 准确率
3.2 下游任务性能
目标检测(COCO,RetinaNet):

- LSNet-T: 34.2 AP(比 StarNet-S1 高 0.6 AP)
- LSNet-B: 39.2 AP(比 PoolFormer-S12 高 3.0 AP)
实例分割(COCO,Mask R-CNN):

- LSNet-S: 37.4 AP^b, 34.8 AP^m
- LSNet-B: 40.8 AP^b, 37.8 AP^m(比 RepViT-M1.1 高 1.0/0.6 AP)
语义分割(ADE20K,Semantic FPN):

- LSNet-T: 40.1 mIoU(比 VAN-B0 高 1.6 mIoU)
- LSNet-S: 41.0 mIoU(比 SHViT-S3 高 1.0 mIoU)
- LSNet-B: 43.0 mIoU(比 SwiftFormer-L1 高 1.6 mIoU)
3.3 鲁棒性评估
在多个基准数据集上的表现:
| 模型 | ImageNet-C(mCE↓) | ImageNet-A | ImageNet-R | ImageNet-Sketch |
|---|---|---|---|---|
| LSNet-T | 68.2 | 6.7 | 38.5 | 25.5 |
| LSNet-S | 65.7 | 9.6 | 39.4 | 27.5 |
| LSNet-B | 59.3 | 17.3 | 43.1 | 30.7 |
LSNet 展现出强大的领域泛化能力和对损坏的鲁棒性,达到最先进的性能。
3.4 消融实验
LS 卷积的有效性:
| 配置 | FLOPs | Top-1(%) |
|---|---|---|
| w/o LS conv. | 0.29G | 69.3 |
| LS conv. | 0.31G | 71.6 |
| (S)W-SA | 0.36G | 70.8 |
| SDTA | 0.37G | 70.6 |
| RepMixer | 0.29G | 69.7 |
➡️ 仅增加 0.02G FLOPs,性能提升 2.3%
大核感知的重要性:
| K_L | FLOPs | Top-1(%) |
|---|---|---|
| w/o LKP | 0.31G | 70.5 |
| K_L=3 | 0.31G | 70.9 |
| K_L=5 | 0.31G | 71.2 |
| K_L=7 | 0.31G | 71.6 |
| K_L=9 | 0.32G | 71.5 |
小核聚合的重要性:
| 配置 | FLOPs | Top-1(%) |
|---|---|---|
| w/o SKA | 0.31G | 70.1 |
| LS conv. | 0.31G | 71.6 |
➡️ LS 卷积比简单的大小核组合高 1.5%
泛化能力验证: 将 LS 卷积应用到其他架构:
- ResNet50: 78.8% → 80.7% (+1.9%)
- DeiT-T: 72.2% → 73.0% (+0.8%)
四、技术亮点总结
4.1 设计哲学
🧠 生物启发:从人类视觉系统的双尺度机制中获得洞察
🎯 异尺度策略:感知和聚合使用不同的上下文范围
⚡ 效率优先:通过深度卷积和分组机制保持低复杂度
🔧 自适应聚合:动态权重适应不同上下文需求
4.2 核心优势
- 性能-效率平衡:在相同或更低计算成本下达到更高准确率
- 鲁棒性强:在各类分布偏移场景下表现优异
- 迁移能力好:在检测、分割等下游任务中持续领先
- 设计简洁:易于实现和集成到现有框架
4.3 理论贡献
论文从数学角度重新审视了 token 混合过程:
对于 token x_i,通用混合过程可表示为:
y_i = A(P(x_i, N(x_i)), N(x_i))
- 自注意力:See Large + Focus Large(全局感知+全局聚合)
- 卷积:See Small + Focus Small(局部感知+静态聚合)
- LS 卷积:See Large + Focus Small(大域感知+小域动态聚合)
五、启示与展望
5.1 对领域的启示
- 跨学科思维:生物视觉系统为网络设计提供宝贵灵感
- 解耦设计:感知和聚合过程可以在不同尺度上进行
- 动态机制:轻量级网络同样需要自适应能力
- 效率优化:通过精心设计可以在低成本下实现高性能
5.2 潜在应用方向
- 🚀 边缘设备部署:低功耗设备上的实时视觉任务
- 📱 移动端应用:手机相机、AR/VR应用
- 🤖 机器人视觉:资源受限的嵌入式视觉系统
- 🎥 视频处理:高效的视频理解和分析
5.3 未来研究方向
- 探索更多生物视觉机制的计算实现
- 研究自适应核大小选择策略
- 将 LS 卷积扩展到其他模态(音频、点云等)
- 结合神经架构搜索自动发现最优配置
六、结论
LSNet 通过引入"See Large, Focus Small"策略,成功地将人类视觉系统的高效机制迁移到深度网络设计中。LSNet 在各种视觉任务中实现了最先进的性能和效率权衡,展现出相对于其他方法的优越性。
核心价值:
- ✅ 提供了轻量级网络设计的新范式
- ✅ 在准确率、速度、鲁棒性三方面取得平衡
- ✅ 为未来高效视觉网络研究指明方向
LSNet:从人类视觉系统中学到的轻量级网络设计&spm=1001.2101.3001.5002&articleId=152664089&d=1&t=3&u=aa66908f0f5f48db82fb23289c0d18a1)
327

被折叠的 条评论
为什么被折叠?



