CVPR 2016 文章链接
1 速读
1.1 论文试图解决什么问题?这是否是一个新的问题?
试图解决Incremental Structure-from-Motion(从下称Incremental SfM)这个领域里没有一个鲁棒的、准确的、完整且可拓展的框架这一问题,是这一领域一直以来的问题,文章提出了一套优秀的框架。
1.2 有哪些相关研究?如何归类?谁是这一课题在领域内值得关注的研究员?
SfM可分为:incremental, hierarchical, and global approaches三种,文章做的是研究最多的incremental SfM。
涉及到Correspondence Search+Incremental Reconstruction两部分研究,简言之找到关系+用关系恢复结构。
在实验部分对比的两个incremetal SfM框架:Bundler、VisualSFM;两个global SfM 框架:DISCO、Theia
1.3 文章的贡献是什么?
提出了一个当时“近乎理想”的incremental SfM并开源了代码COLMAP
①提出了一个关于场景信息的几何方法(geometric verification strategy),增强初始化和三角化的鲁棒性;
②提出了更好的如何选择下一帧的策略,提高了重构的鲁棒性和准确性;
🌂提出了一个鲁棒的三角化方法,在降低计算量的情况下恢复更完整的场景结构;
④将BA+re-triangulation+filter迭代进行,减小了drift的影响;
⑤针对密集图片集,通过合并冗余的视角实现更高效的BA;
1.4 文章解决方案的关键是什么?
对给出的数据抽象提炼出更高维的信息(帧的状态、相机的聚类)加以使用,提升速度和鲁棒性 ①⑤
对直观上的可行方法做出数学抽象(点分布更均匀如何描述,更好的三角化如何描述)②③
理清SfM中各个部分的作用和效果,设计更合理的执行步骤④
1.5 实验如何设计?实验结果足够论证其效果吗?
效果很好
1.6 数据集是什么?
共17个数据集

以下是精读部分
2 基本概念
Structure-from-Motion (SfM):从无序的图片集之中恢复3D结构
①incremental:with an iterative reconstruction component,即序列processing中有迭代重构部分,如下图所示:

②hierarchical:没说
🌂global:没说
以下是各个模块的基本功能描述,有SLAM基础的应该都基本了解
匹配搜索 Correspondence Search:输入照片 I = { I i ∣ i = 1 。。。 N I } \mathcal{I} = \{I_i | i=1。。。N_I\} I={
Ii∣i=1。。。NI}
Feature Extraction:特征提取
output: F i = { ( x j , f j ) , ∣ j = 1... N } \mathcal{F}_i = \{(x_j, f_j), | j=1...N\} Fi={(xj,fj),∣j=1...N}, x j x_j xj 表示特征在图像中的位置, f j f_j fj 表示对应的描述子
Matching:寻找看见相同场景(即特征 F i \mathcal{F}_i Fi)的图片,这里似乎在所有图片间寻找,类似SLAM中LoopClosing的部分而不是Tracking的部分,最常用的方法就是所有图片间两两检测,但是非常耗时。
output:可能的匹配图片对 C = { { I a , I b } ∣ I a , I b ∈ I , a < b } \mathcal{C} = \{\{I_a, I_b\} | I_a, I_b\in \mathcal{I}, a<b\} C={
{
Ia,Ib}∣Ia,Ib∈I,a<b}和特征匹配结果 M a b ∈ F a × F b \mathcal{M}_{ab}\in \mathcal{F}_a\times\mathcal{F_b} Mab∈Fa×Fb
Geometric Verification:用几何方法检验匹配图片对 C \mathcal{C} C。①单应矩阵homography H描述在一个平面上的匹配点对之间的变化;②本质矩阵essential matrix E和基础矩阵fundamental matrix F描述由对极几何描述的匹配点间的关系;🌂RANSAC:鲁棒估计方法,减小离群点的影响。
output:经过验证的照片对 C ‾ \mathcal{\overline{C}} C,通过的匹配结果 M ‾ a b \mathcal{\overline{M}}_{ab} Mab,匹配结果的相关性 G a b G_{ab} Gab
递增式重构 Incremental Reconstruction
Initialization:寻找可以构建高质量初始化的两个初始关键帧
Image Registration:求解PnP问题得到帧间运动。PnP使用2D-3的匹配点计算相机位姿 P c P_c Pc和相机内参 K K K(如果为校准的话),通常使用RANSAC求解
Triangulation:新的相机观察到之前没有的点,用三角化重构点来扩展场景
Bundle Adjustment:BA是优化相机位姿 P c P_c Pc和路标点 X k X_k Xk的非线性方法,能够削减重构部分的Image Registration和Triangulation的开环连接导致的结果偏移。其优化的重投影误差为:
E = ∑ j ρ j ( ∣ ∣ π ( P c , X k ) − x j ∣ ∣ 2 2 ) E = \sum_j \rho_j \left(||\pi(P_c, X_k)-x_j||_2^2\right) E=j∑ρj(∣∣π(Pc,Xk)−x

该篇博客介绍了CVPR2016的一篇论文,针对增量Structure-from-Motion(Incremental SfM)领域提出了一种鲁棒且准确的框架,解决了长期存在的问题。论文涉及CorrespondenceSearch和IncrementalReconstruction,通过改进的初始化、三角化策略和几何验证方法,提升了框架的性能。关键贡献包括优化的BA算法和冗余视图处理,使得在处理密集图片集时效率更高。

1737

被折叠的 条评论
为什么被折叠?



