单应估计homograph estimation、相机位姿估计pose estimation 学习笔记

本文整理了单应性矩阵的不同定义,从内参阵到场景平面参数的转换,探讨了单应阵与相机位姿的关系,并针对求解单应阵的方法和Scannet数据集进行了讨论。重点在于澄清概念,帮助理解图像匹配中的关键概念和公式背后的逻辑。

单应估计homograph estimation、相机位姿估计pose estimation 学习笔记

引言

在学习图像匹配的过程中涉及到了两个相关的任务,即单应估计和相机位姿估计,在学习这两块的时候觉得网上的理论挺混乱的,首先就是公式不统一,光单应阵的定义都有好几种,而且两者都涉及到了相机成像的原理,所以很多公式都类似,但是有的地方有所不同,网上也没有说明两者之间区别和联系的内容,在这里记录一下网上的几种说法以及自己的一些想法,帮自己和大家理一下思路

单应性矩阵

定义版本一

在这里插入图片描述
在这里插入图片描述
这里出现了内参阵,那么就是相机模型,并且默认拍摄的场景位于同一平面上,所以设zw=0并把r3化简掉了。这里让我一开始很迷惑,因为他没有做任何解释就把世界坐标的zw给去掉了。
式子中的s也是比较迷惑的地方,因为好多个版本它的符号都不一样,而且都没有明确给出定义,根据看得好几篇文章目前我对它的理解有几个:深度、相机坐标系中空间点的z坐标、尺度因子

定义版本二

在这里插入图片描述
这里也是假设场景位于同一平面上,公式包含了相机内参Ka、Kb;相机外参R、t;平面参数n、d,其中n为场景平面法向量、d为相机原点与平面的距离。这个公式引入了场景平面的参数进行代换、化简,由于我没有用到,所以没有深入了解。

定义版本三

在这里插入图片描述
我觉得这个式子有点问题,内参33和外参44的维度不能相乘,所以外参最下面一行应该去掉,改成这个式子:
在这里插入图片描述
然后我简单的推推了一下,想总结一下单应阵和相机位姿之间的关系,不知道对不对,大家帮忙看看,原式子中的Z分之一我换成了d分之一,对应版本一中的s,但是它具体代表什么以及背后的原理我还是有点模糊。
在这里插入图片描述
如果推的是对的话,这个是不是就是当场景为平面时,相机位姿变化和单应阵之间的关系呢

单应阵求法

由于单应阵只有八个自由度,所以理论上求出两张图片的四对匹配点就可以解出单应阵,也可以求出大量的匹配点然后用ransac方法解出。但是,我想知道怎么通过其他方法求出单应阵,因为要本来就是要训练图像匹配的算法,不能通过匹配点去生成groundtruth homograph。我用的数据集是scannet,数据里包括了深度图、相机内外参,所以想利用这些groundtruth的数据计算出来单应阵,后来发现只有场景为平面的时候才有单应阵,而且自己推出来的单应阵和位姿的关系式不知道对不对,所以就放弃了求单应的想法。

相机位姿

(未完待续)

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值