PVN3D:最详细的来了,对PVN3D的总结与理解

该文提出了一种基于深度霍夫投票的网络,用于从RGBD图像中估计物体的6DoF姿态。网络首先检测3D关键点,然后使用最小二乘法拟合姿态参数。通过学习每个点到关键点的偏移,网络能够在3D空间中进行投票,减少投影误差。此外,还引入了实例语义分割模块处理多物体场景。实验表明这种方法在处理遮挡和噪声时表现优越。

摘要:从单个RGBD图像得到对象的6DoF对象姿态估计。使用了一种深度霍夫投票网络,以检测对象的3D关键点,然后以最小二乘法拟合的方式估计6D姿态参数。

6DoF:即物体在空间中具有6个自由度,3D平移和3D旋转。6DoF姿态就是说,已知物体在世界坐标系的坐标,求物体在相机坐标系的姿态。即物体从世界系到相机系所需的3D旋转和3D平移。

1.介绍
由于光线,传感器噪声,场景的遮挡和物体的截断等原因,6DoF估计已被证明是一个极具挑战性的问题。有人提出直接使用DNN(深度神经网络)回归对象的旋转和平移,由于所解释的旋转空间的非线性,这些方法的泛华能力往往较差。取而代之的是,最近的工作利用DNN来检测对象的2D关键点,并使用Perspectiven-Point(PnP)算法计算6D姿态参数。尽管这两个阶段的方法执行起来更稳定,但大多数方法还是建立在2D投影之上。投影误差小,但是在真实的3D空间中误差可能很大。3D空间中的不同关键点投影之后可能会重叠,从而很难区分它们。此外,刚性物体的几何约束信息将由于投影而部分丢失。
图一:(a)输入RGBD图片;(b)使用一个深度霍夫投票网络预测每个点相对于关键点的平移偏移;©在同一个对象上每一个点为选择的关键点投票,和将集群的中心选为预测关键点;(d)-(e)最小二乘拟合方法应用于估计6D位姿参数;(f)由估计的6D位姿参数转换后的模型
具体而言,本文提出一种基于霍夫投票(Hough voting)的神经网络,以学习每一个点到3D关键点的偏移并为3D关键点投票,本文的其中一个关键发现是一个简单的几何特性,即在3D空间中,一个刚体上任意两点之间的相对位置关系是固定的。因此,给定物体表面的一个可见点,它的坐标和方向可由深度信息获得,其相对于刚体上预选关键点的平移偏移量也是确定且可学习的。同时,深度神经网络学习逐点欧几里得偏移直截了当,且易于优化。
当场景有多个物体时,本文在网络中引入了

评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值