前言
本文介绍了Mamba-Like Linear Attention (MLLA)模型及其在yolo26中的集成。MLLA结合了Mamba和线性注意力Transformer的优点,线性注意力降低计算复杂度,Mamba有效建模序列。该模型将Mamba的遗忘门和块设计等关键元素与线性注意力结合,还可用位置编码替代遗忘门。我们将MLLA引入yolo26,在检测头的不同尺度特征图上应用。实验表明,改进后的yolo26在目标检测任务中表现良好,体现了MLLA在提升模型性能上的有效性。
文章目录: YOLO26改进大全:卷积层、轻量化、注意力机制、损失函数、Backbone、SPPF、Neck、检测头全方位优化汇总
专栏链接: YOLO26改进专栏
介绍

摘要
Mamba作为一种具有线性计算复杂度的状态空间模型,在处理高分辨率视觉任务方面展现出卓越的效率表现。本文系统揭示了Mamba模型与线性注意力Transformer之间存在的显著相似性,而后者在实际应用中通常表现逊于传统Transformer架构。通过深入分析高效Mamba与性能欠佳的线性注意力Transformer之间的相似性及差异性,本研究提供了全面解析,揭示了Mamba成功的关键机制。具体而言,我们在统一数学框架下重新形式化了选择性状态空间模型与线性注意力,将Mamba重新表述为具有六个主要差异特征的线性注意力Transformer变体:输入门控机制、遗忘门控机制、快捷连接结构、无注意力归一化设计、单头注意力配置以及改进的块设计架构。针对每个设计要素,我们进行了细致的优劣势分析,并通过实验验证了其对视觉任务性能的具体影响。研究结果表明,遗忘门控机制和块设计架构是Mamba成功的关键贡献因素,而其余四个设计特征的重要性相对较低。基于这些发现,我们通过将这两个核心设计优势引入线性注意力机制,提出了一种类Mamba线性注意力(MLLA)模型。该模型在图像分类和高分辨率密集预测任务中均超越了多种视觉Mamba模型,同时保持了可并行计算特性和快速推理速度优势。相关代码可在https://github.com/LeapLabTHU/MLLA获取。
订阅专栏 解锁全文
7420

被折叠的 条评论
为什么被折叠?



