【有向目标检测】DCL密集编码标签

【有向目标检测】DCL密集编码标签


论文地址: https://arxiv.org/abs/2011.09670

代码地址:https://github.com/yangxue0827/RotationDetection

参考:https://zhuanlan.zhihu.com/p/354373013

前言

卷积参数计算
F l o p s = 2 × C i × K 2 × H × W × C o P a r a m e s = C i × K 2 × C o Flops = 2 \times C_i \times K^2 \times H \times W \times C_o\\ Parames = C_i \times K^2 \times C_o Flops=2×Ci×K2×H×W×CoParames=Ci×K2×Co
其中 C i C_i Ci C o C_o Co分别表示输入输出的通道数,K表示卷积层的卷积核,H和W表示特征图的高和宽。

1. 动机

DCL主要从两方面进行了优化:

  • 过于厚重的预测层
  • 对类正方形目标检测的不友好
1.1厚重的预测层

CSL编码和独热编码均属于稀疏编码(Sparsely Coded Label,SCL)。稀疏编码的缺点是需要较长的位数来进行编。

CSL编码的编解码如下:

请添加图片描述

其中 ω = A R / C θ \omega=AR/C_{\theta} ω=AR/Cθ A R AR AR表示角度范围(默认是180), C θ C_{\theta} Cθ 所划分的角度类别。

CSL编码方式或独热编码时的预测层厚度:

请添加图片描述

其中 A A A表示anchor的数量。

使用回归进行角度预测时,预测层厚度为:
Th r e g = A \text{Th}_{reg} = A Threg=A
以 A=21, AR=180, ω \omega ω=1 为例,CSL编码方式与独热编码的预测层厚度是3780,而基于回归的预测层厚度只有21。这使得基于稀疏编码方法的参数量(Params)和计算量(GFlops)相比基于回归方法增加了23.42%和82.96%,造成模型训练和测试的效率低下。

1.2类正方形目标检测不友好

不管是CSL还是DCL,为了避免角度周期性(PoA)和边的交换性(EoE)问题,它们均采用了“角度分类+长边定义法”的组合。长边定义法有这样一个问题,他无法较好定义一个类正方形目标,如下图所示:

请添加图片描述

图的左边是gt,右边是一种“视觉可行”的预测结果,之所以说“视觉可行”是因为此时的计算误差非常大。这个误差主要来源于角度(类正方形目标两边近似相等,因此尽管wh的顺序相反,误差依然很小)。仔细观察可以发现这两种框的角度差约等于 90。

目标长宽比的减小使得评估(IoU)和损失( l n ln ln-norm)之间的不一致性逐渐被放大

其实使用周期为90的定义方法对类正方形目标来说更加合适(如OpenCV定义法),长边定义法有明显的缺陷。

2.DCL(Densely Coded Labels, DCL)

2.1.两类密集编码方法
  • 二值编码(Binary Coded Label, BCL)格雷编码 (Gray Coded Label, GCL)

预测层厚度计算公式如下:
Th d c l = A × l o g 2 ( A R / ω ) \text{Th}_{dcl}=A \times log_2(AR/\omega) Thdcl=A×log2(AR/ω)

  • 优点:可以用更短的编码长度表示更大范围的值。 因此,它们可以有效解决基于CSL和One-Hot的方法中编码长度过长的问题。

  • 缺点:第一个问题是二值编码没有了CSL方法中强调的容忍性。3和4在三位的二进制编码结果分别为011和100。格雷码虽然任何两个相邻数的格雷码只有一位不同,最大值和最小值之间也只有一位数字不同,具有一定的容忍性,但是具有较大差异的角度的编码差异不是很明显, 如1和6。

请添加图片描述

第二个问题所划分的角度类别数需要是2的指数倍才能保证每一种编码都对应一种角度,否则会有大量冗余的编码(尽管实验验证这个问题影响不大)。

2.2.针对类正方形目标

针对类正方形和容忍性消失,DCL设计了一个损失权重,具体公式如下:

请添加图片描述
请添加图片描述

具体的想法是通过预测和gt的十进制差值来引入容忍性三角函数的引入来解决角度周期性和类正方形检测问题(通过长宽比来调整 α \alpha α参数,从而调整三角函数的周期),FL为Focal Loss

3.实验结果

尽管理论上 ω \omega ω越小,理论误差越小,预测精度上限越高,但是会增加角度分类的难度。 ω \omega ω越大也不好,太大的话理论误差太大,预测精度上限太低。一个合适的 ω \omega ω取值范围是[180/32-180/256]

基于**分类的角度预测方法(CSL和DCL)**比基于回归方法在高精度 mAP75 上更有优势,并且DCL比CSL效果更好,效率也更高

4.局限性

基于分类预测的方法存在理论误差以及模型参数量和计算量的增加

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值