前言
本文介绍了坐标注意力(Coordinate Attention)及其在YOLOv8中的结合应用。现有通道注意力常忽略位置信息,坐标注意力将位置信息嵌入通道注意力,通过坐标信息嵌入和坐标注意力生成两个步骤增强特征表达。它把通道注意力分解为两个1D特征编码过程,能捕获长距离依赖并保留位置信息,生成的注意力图可增强目标表示。我们将CoordAtt代码引入指定目录,在ultralytics/nn/tasks.py中注册,配置yolov8-CoordAttention.yaml文件,最后经实验脚本进行训练验证。
文章目录: YOLOv8改进大全:卷积层、轻量化、注意力机制、损失函数、Backbone、SPPF、Neck、检测头全方位优化汇总
专栏链接: YOLOv8改进专栏
文章目录
介绍

摘要
近期的移动网络设计研究显示,通道注意力(例如,压缩-激励注意力)在提升模型性能方面具有显著效果,但它们通常忽略了位置信息,而这对于生成空间选择性的注意力图是非常重要的。在本文中,我们通过将位置信息嵌入到通道注意力中,提出了一种用于移动网络的新型注意力机制,我们称之为“坐标注意力”。与通过2D全局池化将特征张量转换为单个特征向量的通道注意力不同,坐标注意力将通道注意力分解为沿两个空间方向分别聚合特征的两个1D特征编码过程。通过这种方式,可以沿一个空间方向捕获长距离依赖,同时沿另一个空间方向保留精确的位置信息。然后,所得到的特征图被分别编码为一对方向感知和位置敏感的注意力图,这两种图可以互补地应用于输入特征图,以增强感兴趣对象的表示。我们的坐标注意力简单且可以灵活地嵌入到经典的移动网络中,如MobileNetV2、MobileNeXt和EfficientNet,几乎不增加计算开销。广泛的实验表明,我们的坐标注意力不仅对ImageNet分类有益,更有趣的是,在下游任务中,如目标检测和语义分割,表现得更好。
创新点
- 将位置信息嵌入到通道注意力中,提升了移动网络设计的性能。
- 通过两个1D特征编码过程聚合沿着两个空间方向的特征,捕获长距离依赖性,并保留精确的位置信息。
- 生成方向
订阅专栏 解锁全文
1万+

被折叠的 条评论
为什么被折叠?



