一、本文介绍
本文给大家带来的改进机制是利用Swin Transformer替换YOLOv11中的骨干网络其是一个开创性的视觉变换器模型,它通过使用位移窗口来构建分层的特征图,有效地适应了计算机视觉任务。与传统的变换器模型不同,Swin Transformer的自注意力计算仅限于局部窗口内,使得计算复杂度与图像大小成线性关系,而非二次方。这种设计不仅提高了模型的效率,还保持了强大的特征提取能力。Swin Transformer的创新在于其能够在不同层次上捕捉图像的细节和全局信息,使其成为各种视觉任务的强大通用骨干网络。亲测在小目标检测和大尺度目标检测的数据集上都有涨点效果。
(本文内容可根据yolov11的N、S、M、L、X进行二次缩放,轻量化更上一层)

目录
二、Swin Transformer原理

论文地址:官方论文地址
代码地址:官方代码、地址

订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=143100866&d=1&t=3&u=a845cf89787649c2b75987e866f76762)
3200

被折叠的 条评论
为什么被折叠?



