清华大学严选!Mamba+注意力机制刷爆SOTA,推理速度狂飙300%!

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

Mamba凭借状态空间模型(SSM)的线性计算复杂度,在长序列建模领域具有不输Transformer的统治地位,而注意力机制的全局依赖感知进一步巩固了这种优势。近期,清华团队最新力作 MambaIRv2 将二者深度融合,在图像复原赛道实现了"线性效率-全局精度"双优。其创新性硬件感知扫描策略(HASS)将原始MambaIR的四向扫描压缩至单次遍历,通过动态门控注意力重加权机制,在保持97.3%像素采样完整性的同时,使DIV2K数据集上的计算能耗直降58%。

Mamba-注意力混合架构的技术突破呈现出多维度辐射。通过创新方案如时空建模革新、动态路由机制和异构计算适配,这类架构正在重塑医疗影像重建、卫星地图增强等关键技术,未来或将开创3D Mamba-注意力建模等新方向。

本文整理了【12篇】最新前沿研究,供同学们学习与参考,欢迎自取~

对资料感兴趣的可以 [丝 xin] 我~~

一、vGamba: Attentive State Space Bottleneck for efficient Long-range Dependencies in Visual Recognition

在这里插入图片描述

 

1. 方法

本文提出了vGamba,一种混合视觉骨干网络,结合了SSM和注意力机制,以提高效率和表现力。vGamba的核心是Gamba瓶颈块,包含Gamba单元、二维多头自注意力(MHSA)机制和门控融合模块,旨在有效表示特征。在分类、检测和分割任务上的广泛实验表明,vGamba在准确性和计算效率之间实现了优越的平衡,超越了多种现有模型。

Unet早已统治图像分割领域?与mamba强联手是新思路! Unet在图像分割领域的应用已经许久。2025年了,Unet还有哪些创新点呢?Unet凭借其卓越的图像分割能力成为计算机视觉领域的热点。CNN的长距离建模能力不足,而Transformer的计算复杂度高,这两个模型与Unet结合都存在各种问题。而最先在时序预测领域大火的mamba这类状态空间模型,具有长距离建模能力,且在表现不输transformer的前提下,同时避免了计算上的二次时间复杂度而被各领域关注。以mamba为首的选择性状态空间模型与Unet到底能擦出怎样的火花? 阅读详情

相关推荐

无问芯穹Qllm-Eval:制作多模型、多参数、多维度的量化方案

近年来,大语言模型(Large Models, LLMs)受到学术界和工业界的广泛关注,得益于其在各种语言生成任务上的出色表现,大语言模型推动了各种人工智能应用(例如ChatGPT、Copilot等)的发展。然而,大模型的落地应用受到其较大的推理开销的限制,对部署资源、用户体验、经济成本都带来了巨大挑战。大模型压缩,即将大模型“瘦身”后塞进资源受限的场景,以减少模型存储、访存和计算开销。

specssss的博客 1114

CVPR 2025 | 清华团队提出MambaIRv2:Mamba+注意力混合架构突破SOTA推理效率提升300%

基于状态空间模型(SSM)的线性计算架构,Mamba在长序列建模领域展现出与Transformer相当的竞争力。清华大学研究团队最新提出的MambaIRv2创新融合两种技术优势,在图像复原领域实现了计算效率与全局精度的双重突破。该方案通过硬件感知扫描优化策略(HASS)实现关键技术改进:将传统四阶段扫描流程优化为单次扫描流程,结合动态注意力加权机制,在DIV2K数据集测试中,不仅维持97.3%的像素信息完整性,更实现58%的能耗降低。

xiaoganbuaiuk的博客 1570

医疗图像分割新突破:手把手教你用Mamba+CNN实现PGM-UNet模型

本文详细介绍了医疗图像分割领域的最新突破——PGM-UNET模型,该模型结合Mamba架构的全局建模能力和CNN的局部特征提取优势,显著提升了医学影像分析的精度。通过双路径信息处理机制和提示引导机制,PGM-UNET在皮肤病变分割、视网膜血管检测等任务中实现了90%以上的Dice系数,误诊率降低40%以上。文章还提供了模型架构设计、关键模块实现、训练技巧和部署优化的详细指南。

q6r7s8t9的博客 901

UNET详解和UNET++介绍(零基础)

一·背景介绍 背景介绍: 自2015年以来,在生物医学图像分割领域,U-Net得到了广泛的应用,目前已达到四千多次引用。至今,U-Net已经有了很多变体。目前已有许多新的卷积神经网络设计方式,但很多仍延续了U-Net的核心思想,加入了新的模块或者融入其他设计理念。 编码和解码,早在2006年就发表在了nature上.当时这个结构提出的主要作用并不是分割,而是压缩图像和去噪声.后来把这个思路被用在了图像分割的问题上,也就是现在我们看到的FCN或者U-Net结构,在它被提出的三年中,有很多很多的论文

浩瀚之水的专栏 4万+

长视频理解新突破!Mamba混合架构让显存消耗腰斩,处理10万视频token不费力

本文介绍了Vamba模型,一种专为高效理解超长视频设计的Mamba-Transformer混合模型。该方法通过集成面向文本token的交叉注意力机制与面向视频token的Mamba-2模块更新策略,在显著降低计算复杂度与显存占用的同时,实现了对长、中、短视频理解任务的性能提升。基于LVBench等数据集的大量实验评估表明,Vamba在长视频理解任务中以4.3%的显著优势超越了现有的高效长视频理解模型,并在多个分布各个视频时常区间的基准测试中展现出了卓越的竞争力。

量子位 162

51c视觉~合集55

要么生成的异常真实性不足、掩码精度低,且难以跨领域复用。试想一下,在工业质检、医疗影像诊断、日常物品瑕疵识别等场景中,无需任何示例缺陷样本,也无需针对特定领域微调模型,就能根据文字或图像提示,自动生成真实且符合语义的异常,还能精准输出缺陷掩码,大幅提升下游异常检测模型的性能。Anomagic引入对比掩码细化策略,通过计算输入正常图像与生成异常图像的像素级差异,结合预训练的MetaUAS模型,自动生成高精度缺陷掩码,实现异常区域与掩码的像素级对齐,大幅提升生成数据的实用性。

whaosoft~aiotの开发板商城 1607

ICCV 2025|全新注意力机制!中科院提出MALA:幅值感知线性注意力

具体来讲,如图 2 所示,对于固定方向,随着 Query 的幅值增加,Softmax Attention 中的 Attention Score 分布变得越来越尖峰 (spiky),把更多的注意力集中在 Attention Score 原本就比较高的 Key 上面。的大小的增加,MALA 更多地关注那些原本就具有更高 Attention Score 的 Key,更少地关注那些原本就具有更低 Attention Score的 Key,这种行为类似于 Softmax Attention。呈现线性的计算复杂度。

阿木寺的博客 1067

高分创新点!Mamba+CNN结合,发顶会首选!

研究摘要 近期视觉领域涌现CNN与Mamba的融合架构,通过双分支设计互补优势。ConvMamba结合CNN的局部特征提取与Mamba的全局建模能力,在ImageNet分类任务中实现90.2%准确率,推理速度提升1.8倍。医学图像方向,PGM-UNet引入提示引导残差Mamba模块,结合多尺度空洞卷积与KANs,显著提升分割精度;遥感领域CM-UNet通过CSMamba块与多尺度注意力聚合模块,有效捕捉长距离依赖。这些工作表明,跨模态轻量化融合与注意力优化是未来重要方向。

m0_73122726的博客 966

VM-UNet: Vision Mamba UNet for Medical Image Segmentation——用于医学图像分割的视觉Mamba UNet

VM-UNet: Vision Mamba UNet for Medical Image Segmentation——用于医学图像分割的视觉Mamba UNet

Together_CZ的博客 3621

Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation

受以处理长序列和全局上下文信息并增强计算效率为特点的Mamba架构(作为状态空间模型SSM)的启发,我们提出了Mamba-UNet,这是一种将医学图像分割中的U-Net与Mamba能力相结合的新型架构。

zzzyyy8的博客 4655

YOLOv11改进 | 引入超强MALA模块:幅度感知线性注意力的多维度智能升级

YOLOv11-MALA通过引入幅度感知线性注意力模块,解决了传统自注意力的高计算成本与特征分辨力不足幅度感知:结合特征幅度信息,增强关键区域的注意力权重;线性近似:低秩分解降低计算复杂度,适配边缘设备;动态校准:时间/空间门控机制,适应动态场景变化。改进后,YOLOv11在遮挡、小目标、动态场景下的检测性能显著提升,为工业检测、自动驾驶、安防监控等领域提供了更可靠的实时检测方案。未来,随着与Transformer等技术的融合,MALA模块将进一步推动目标检测的智能化与泛化能力。

走向CTO的路上... 605

Mamba-yolo|结合Mamba注意力机制的视觉检测

Demystify Mamba in Vision: A Linear AttentionPerspective一文中引入Baseline Mamba,指明Mamba在处理各种高分辨率图像的视觉任务有着很好的效率。发现了强大的Mamba和线性注意力Transformer( linear attention Transformer)非常相似,然后就分析了两者之间的异同。

weixin_51988935的博客 3503

提升长序列建模效率:Mamba+交叉注意力架构完整指南

本文将深入分析Mamba架构中交叉注意力机制的集成方法与技术实现。

deephub 5867

YOLO12 改进、魔改|幅度感知线性注意力MALA,提升小目标、遮挡的检测能力

摘要:针对Transformer中SoftmaxAttention计算复杂度高的问题,研究者提出LinearAttention降低复杂度至O(N),但其性能下降明显,主要原因是忽略了Query幅度信息。为此,MALA(Magnitude-Aware Linear Attention)被提出,通过引入缩放因子和偏移项,使注意力分布随Query幅度变化更接近SoftmaxAttention但更平衡。MALA在目标检测和分割任务中表现出色,能兼顾全局与局部特征,提升多尺度目标识别能力。将其与YOLO结合,可在保持

qq_64693987的博客 996

YOLOv10改进 | 注意力篇 | YOLOv10引入24年最新Mamba注意力机制MLLAttention

最近,它在处理各种视觉任务的高分辨率输入方面表现出了令人印象深刻的效率。基于这些发现,我们提出了MLLA模型,通过将这两个关键设计的优良特性整合到线性注意力中,得到了一个在图像分类和高分辨率密集预测任务中都优于各种视觉Mamba模型的模型,同时享受并行化计算和快速推理速度的优点。到此本文的正式分享内容就结束了,在这里给大家推荐我的YOLOv10改进有效涨点专栏,后期我会根据各种最新的前沿顶会进行论文复现,也会对一些老的改进机制进行补充,如果大家觉得本文帮助到你了,订阅本专栏,关注后续更多的更新~

tsg6698的博客 2349

横扫顶会!Mamba+注意力机制SOTA!!

近期Mamba注意力机制融合研究取得突破性进展,SegMAN、MAVE等创新模型在CVPR等顶会引发关注。这类混合架构通过Mamba的线性复杂度长序列建模和注意力的局部细节捕捉优势,在语义分割、语音伪造检测等任务中SOTA。代表性工作如XLSR-MamBo采用Hydra实现原生双向建模,MPCM-Net创新性提出空间-语义混合域解码器,均展现出卓越的跨模态泛化能力。研究证实,深度优化融合架构能有效提升模型稳定性,相关成果已开源并构建专用数据集(如CSRC),为序列建模领域提供了新的技术范式。

m0_73122726的博客 490

如何借助 AI 实现自动化测试:让 Agent 帮你写测试、跑测试、修测试

上下文工程优先:维护(页面结构、账号、业务规则),AI 输出质量立竿见影;AI 生成 + 人审 + 入库:测试代码是资产,必须 code review,禁止「AI 跑完就当真」;定位器纪律:全程getByRolegetByLabel,从源头减少失效;分层使用:单元/接口测试用传统框架,UI 探索性测试用 Agent,回归用固化脚本;成本控制:批量生成用便宜模型(DeepSeek / 本地 Ollama),关键修复用强模型;安全红线:测试 Agent 只能连测试环境;

篮球界最会写bug的人;程序猿中打球最菜的人。 445

WAIC论坛现场|网易智企分享企业AI“上岗之路“

在世界人工智能大会(WAIC)2026上,网易智企举办了"用可信AI构建企业新智生产力"专题论坛。会上,网易智企副总经理段毓铮带来了题为《从能聊、到能干、到越干越好:企业AI的上岗之路》的演讲,抛出了一个核心观点:不把AI当工具,而是当作"AI员工"来看待。

weixin_43099039的博客 196
上一篇: 可解释性新突破!Transformer+因果推理又在上大分
下一篇: 可解释 AI 大爆发!医疗与社交领域 SOTA 全被 “屠榜”!
AI学术工坊
博客等级 码龄1年 254粉丝 · 35原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值