摘要
多模态融合是自动驾驶系统感知中的一个基本任务。然而,由于原始数据的噪声,信息的未充分利用和多模态传感器的失调,实现一个相当好的性能并不是一个容易的事情。在这片文章中,作者对于现有的基于多模态自动驾驶感知任务方法进行了文献综述。作者对于超过50片论文进行了一个详细的分析,利用感知传感器(包括激光雷达和相机)试图解决目标检测和语义分割的任务。
与传统的融合模型分类方法不同,作者提出了一种创新的方法,从融合阶段的角度来看,通过更合理的分类法将其分为两大类,四个小类;此外,作者还深入研究了目前的融合方法,关注了仍然存在的问题并且展针对于一些潜在的研究展开了讨论。
总结来说,本文希望提出一种针对于自动加沙感知任务的新的多模态融合的分类方法,激发一些未来基于融合的技术的思考。
introduction
感知
感知是自动驾驶的一个重要模块,这些任务包括但是不限于二维/三维目标检测、语义分割、深度完成和预测,这些任务依赖于安装在车辆上的感知器来从环境中采集原始数据。 大多数现有的方法是对激光雷达和相机捕获的点云和图像数据及逆行感知任务,有不错的效果。
单模态的缺陷
然而,单模态数据感知存在缺陷。比如摄像机的数据主要采集在前视图的下方位置,对象可能会在更加复杂的场景中被遮挡,给目标检测和语义分割带来了挑战。此外,由于机械结构,激光雷达在不同的距离下会有不同的分辨率,而且会受到一些障碍物比如青蛙和暴雨等极端天气的影响。
这两种模式在不同方面都擅长,如果两者可以结合,那么就会产生更好的感知性能。
多模态融合阶段
近年来,用于自动驾驶感知任务的多模态融合方法发展迅速,从更新进的跨模态特征表示和不同模态中更可靠的传感器到更复杂、更鲁棒的深度学习和多模态融合技术。
然而,关注多模态融合本身的比较少,其中大多数遵循传统把多模态融合分为三类:早期融合、深度融合和后期融合,关注的是在深度学习中融合特征的阶段,无论是数据级、特征级或者是建议级。
首先,这种分类方法并没有明确定义每个级别的特征表示;其次,建议激光雷达和相机两个分支在处理过程中总是对称的,忽视了激光雷达分支建议级特征和相机分支数据级特征融合情况。
本文中,作者提出一种创新的方法,从融合阶段的角度,通过更加合理的分类法,将50多篇论文分为两个主要类和四个次要类:
1、 本文提出一种创新的多模态融合方法分类,包括两大类:强融合和弱融合;强融合中的四个小类:早期融合、深度融合、晚期融合和不对称融合,这是由激光雷达和相机分支的特征表示明确定义的。
2、本文对于激光雷达和相机分支的数据格式和表示进行深入的调查,并且探讨他们的不同特征。
3、对于仍然存在的一些问题进行了细致的分析,探讨了潜在的研究方向。
自动驾驶中的感知任务和开放数据集
多模态传感器融合感知任务
一般来说,有一些任务可以解释为驱动感知任务,包括目标检测、语义分割、深度补全和预测等;本文主要关注前面两个任务,此外,它们还包括检测障碍物、交通灯、穿越交通标志、分割车道或者自由空间等等。下面这张图显示了自动驾驶过程中的感知任务概述:

目标检测
对于了解汽车周围环境至关重要,无人驾驶的车辆需要检测道路上的静止和移动的障碍物。研究人员会建立(汽车、行人、自行车、等等)的框架,交通灯检测、交通标志检测也是。
一般来说,目标检测使用由参数表示的矩形或者长方体来来帮顶预定义类别的实体,比如汽车或者行人,这需要在定位和分类方面都很出色。由于缺乏深度通道,2D目标检测通常简单地表示为(x、y、h、w、c),而3D目标检测边界框通常表示为(x、y、z、h、w、l、θ、c)。
语义分割
可通行空间的检测是许多自动驾驶的模块,将地面的像素划分为可驾驶和不可驾驶的区域。一些车道线检测也会使用多类语义分割掩码来表示道路上的不同车道。
语义分割的本质是将输入数据的基本成分,比如像素和三维点聚类到包含特定语义信息的多个区域中。比如说给定图像像素或者3D点云数据和一组预定义的候选标签,使用一个模型来给每个像素或点di分配k个语义标签中选定的一个或所有概率。
其他感知任务
还包括目标分类、深度补全和预测。虽然本文没有详细介绍,但是可以看作是目标检测或者是语义分割的变体。
公开数据集
超过十个数据集与自动驾驶感知相关,然而,只有KITTI,Waymo和nuScenes常用。

KITTI
包括二维、三维和鸟瞰图检测任务。收集了7481张训练图像和7518张测试图像以及相应的点云。只有三个物体被标记为汽车、行人和骑自行车的人,有超过200K的3D对象注释,按照检测难度分为三类:易、中、难。对于KITTI目标检测任务,经常使用平均精度进行比较。此外,还利用平均方向相似度来评估联合检测对象和估计其三维方向的性能。
Waymo
有798个训练场景、202个测试验证、150个测试场景。每个场景跨度20秒,带有车辆、自行车和行人的注释。对于评估3D目标检测任务,Waymo由四个指标组成: AP/L1、APH/L1、AP/L2、APH/L2。更具体地说,AP和APH代表两种不同的性能度量,而L1和L2包含具有不同检测困难的对象。对于APH,其计算方法与AP相似,但按航向精度进行加权。
NuScenes
包括1000个驾驶场景,其中700个用于训练,150个用于验证,150个用于测试。配备了相机、激光雷达和雷达传感器,在每个关键帧中注释了23个对象类,包括不同类型的车辆、行人和其他车辆。NuScenes使用AP、TP进行检测性能评估。此外,它提出了一种创新的标量评分作为AP计算的nuScenes检测评分(NDS),隔离不同的误差类型。
激光雷达和图像表示
深度学习模型仅限于输入的表示,为了实现该模型,需要在将数据输入模型之前,通过一个复杂的特征提取器对原始数据进行预处理。
对于图像分支来说,大多数现有方法都保持于下游模块输入的原始数据相同的格式。然而,激光雷达的分支高度依赖于数据格式,它强调不同的特征,并且极大地影响下游模型的设计。因此,我们将它总结为因此,我们将它总结为基于点的、基于体素(三维空间中定义一个点的图象信息的单位)的和基于二维映射的点云数据格式,适合于异构型的深度学习模型。
图像表示
单目相机是二维或者三维目标检测和语义分割任务中最常用的数据采集传感器,提供了丰富的纹理信息的RGB图像。具体来说,对于每个像素为(u,v)(u,v)(u,v)的图像,他有一个多通道特征向量F(u,v)={ R,G,B,...},F_{(u,v)}=\lbrace R, G, B, ...\rbrace,F

本文综述了自动驾驶中多模态感知任务的方法,尤其关注激光雷达和相机数据的融合。作者提出了新的分类体系,区分了强融合(早期、深度融合、晚期、不对称)和弱融合,以及存在的问题和未来研究方向。
&spm=1001.2101.3001.5002&articleId=134290030&d=1&t=3&u=4f8b34da4a5d4a1a842640fd33ca669e)
3163

被折叠的 条评论
为什么被折叠?



