RT-DETR改进策略【卷积层】| CVPR 2025:动态双曲正切(Dynamic Tanh,DyT)模块,维持模型性能与训练稳定性

一、本文介绍

本文记录的是利用DyT模块优化RT-DETR的目标检测网络模型

DyT(Dynamic Tanh,动态双曲正切模块) 的设计旨在,替代归一化层,在无需计算激活统计量的情况下实现对极端值的压缩和输入的动态缩放。本文将深入研究DyT的原理,并将其应用到RT-DETR中,通过以元素级操作替换归一化层、保留非线性压缩特性,维持模型性能与训练稳定性


专栏目录:RT-DETR改进目录一览 | 涉及卷积层、轻量化、注意力、损失函数、Backbone、SPPF、Neck、检测头等全方位改进

专栏地址:RT-DETR改进专栏——以发表论文的角度,快速准确的找到有效涨点的创新点!


二、DyT介绍

Transformers without Normalization

2.1 出发点

归一化层在现代神经网络中应用广泛,被视为训练深度网络的关键组件。然而,研究发现Transformer中的层归一化(LN)层映射输入到输出的曲线类似tanh函数,呈S形,会缩放输入激活并压缩极端值。

基于这一观察,研究人员提出动态双曲正切(Dynamic Tanh,DyT)模块,作为归一化层的替代方案。

2.2 结构原理

DyT层的定义为 D y T ( x ) = γ ∗ t a n h ( α x ) + β DyT(x)=\gamma * tanh (\alpha x)+\beta DyT

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Limiiiing

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值