一、本文介绍
本文记录的是基于EfficientViT的RT-DETR轻量化改进方法研究。EfficientViT 通过构建多尺度线性注意力模块将全局感受野与多尺度学习相结合,并以此模块为核心构建网络,构建轻量级且硬件高效的操作,以提升性能并降低硬件部署难度。
本文在替换骨干网络中配置了原论文中的EfficientViT_M0、EfficientViT_M1、EfficientViT_M2、EfficientViT_M3、EfficientViT_M4和EfficientViT_M5 6 种模型,以满足不同的需求。
| 模型 | 参数量 | 计算量 | 推理速度 |
|---|---|---|---|
| rtdetr-l | 32.8M | 108.0GFLOPs | 11.6ms |
| Improved | 20.6M | 64.8GFLOPs | 10.2ms |
专栏目录:RT-DETR改进目录一览 | 涉及卷积层、轻量化、注意力、损失函数、Backbone、SPPF、Neck、检测头等全方位改进
文章目录
二、EfficientViT结构详解
EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction
2.1 设计出发点
- 解决高分辨率密集预测模型的部署难题:高分辨率密集预测在现实世界有广泛应用,但现有先进模型计算成本高,难以在硬件设备上部署。
- 兼顾性能与硬件效率:之前的模型通过复杂结构或硬件低效操作获得性能,
EfficientViT旨在用轻量级且硬件高效的操作实现全局感受野和多尺度学习,以提升性能并降低硬件部署难度。
2.2 原理
2.2.1 多尺度线性注意力模块(Multi - Scale Linear Attention)
- ReLU线性注意力实现全局感受野:使用
ReLU线性注意力替代softmax注意力来实现全局感受野。在ReLU线性注意力中,相似性函数定义为 S i m ( Q , K ) = R e L
订阅专栏 解锁全文

1283

被折叠的 条评论
为什么被折叠?



