ECCV2022解读:首篇基于环视相机的端到端自动驾驶框架!

自动驾驶端到端1:ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning】 论文“ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning“,22年7月,作者来自上海交大、上海AI实验室、加州圣地亚哥分校和京东公司的北京研究院。。具体而言,提出一种以自车为中心对齐(egocentric-aligned)的累积技术,在感知BEV转换之前保留3-D空间中的几何信息;作者设计一种双路(dual pathway )模型,将过去的运动变化考虑在内,用于未来的预测; 阅读详情

原文链接:ECCV2022解读:首篇基于环视相机的端到端自动驾驶框架!

论文地址: https://arxiv.org/abs/2207.07601

项目地址: https://github.com/OpenPerceptionX/ST-P3

7月4日,ECCV 2022放榜,今年共收到8000多篇投稿,其中1629篇论文被接收,接收率不到20%。上海人工智能实验室自动驾驶团队与上海交通大学严骏驰副教授团队合作的论文《ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning》被ECCV 2022接收。该论文提出了第一个基于环视相机的,具有显示中间表征结果的端到端自动驾驶框架。针对感知-预测-规划三个子模块,团队分别做了提升时空特征学习性能的特殊设计,包括:基于累积的静态物体特征增加与动态物体特征对齐,结合历史特征变化与未来不确定性建模的双路预测模块,网络前部特征融合提升规划性能。

图片

端到端一体化的训练方式下,三个模块的性能在nuScenes上的感知、预测与开环规划效果均超越相应的方法达到SOTA,并且在CARLA上的测试也可以超越经典的基于多模态的Transfuser方法,下面为大家对这篇文章进行解读。

1如何提高视觉的时空特征性能实现端到端训练?

自从1988的Alvinn开始,端到端自动驾驶便进入了人们的视野,随着深度神经网络的发展,在近五年成为了学术及工业界的一个流行话题。基于RL/IL的一系列工作在CARLA等benchmark上展现了不俗的效果。但是这些方法大都只是简单通过一个预测头输出控制信号,是一个黑盒模型。此类黑盒模型做出的驾驶决策的原因我们无从得知,在系统出现问题后也难以排查,这对安全驾驶形成了重大挑战。考虑到端到端自动驾驶的安全性,一个具备良好可解释能力的模型对于安全驾驶来说很有必要。

过去几年,Uber ATG团队在LiDAR的感知决策一体化方面作了充分的研究,有NMP[1]、DSDNet[2]、P3[3]、MP3[4]等工作,基于纯视觉的端到端的感知决策一体化模型却鲜有研究。但考虑到成本问题以及视觉方面的优势(交通灯、远距离检测等),基于纯视觉的框架也具有较大的研究潜力。如果每个模块都设计精巧,那么每个任务在感知、预测和规划方面的性能应该提高到什么程度,如何提高视觉的时空特征性能实现端到端训练?

从以上的问题出发,团队提出了ST-P3网络(ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning)。

2显示中间表征的环视端到端自动驾驶框架

ST-P3 pipeline

图片

ST-P3整体pipeline

ST-P3, 一个基于视觉的可解释的端到端系统,该系统可以改善感知、预测和规划的特征学习,上图描述了它的整体框架。多个时刻下的环视相机图像会依次经过感知、预测、规划模块,输出最终的规划路径。其中,感知和预测模块的feature输出,可以经过decoder得到不同类型的场景语义信息,增强可解释性。团队还通过每个模块中特殊的设计来增强时空特征的学习,下面将对每个模块进行详细的介绍。

感知模块(Egocentric Aligned Accumulation)

图片

感知模块的时空融合算法示意图

基于视觉的方法的第一个关键挑战是将特征表示从透视图适当地转换为鸟瞰图 (BEV) 空间。开创性的 LSS [5]方法从多视图相机中提取透视特征,通过深度估计将它们提升为 3D 并融合到 BEV 空间中。而为了进一步提高特征的表征能力,可以将时间信息合并到框架中,我们在 3D 空间中累积所有过去对齐的特征,尽可能保留更多的几何信息。

该模块中我们分为空间融合和时序融合:

  • 空间融合:在某一时刻时,我们首先将用LSS方法提取的各个视角的图片特征统一转化到以自车为中心的3D空间中,然后为了下游任务的处理方便,需将过去时刻的特征统一转化到当前特征。最后我们将该3D空间的特征进行“压扁”,在垂直坐标轴上进行累加从而将3维特征转化为2维特征,大大减小后续的计算量。值得注意的是我们在3D空间进行特征对齐,是考虑到raw/pitch角不为0的时候BEV对齐方法会存在问题。

  • 时序融合:注意到不同时刻的对应的相同位置应具有类似的特征,比如车道线,静止的车辆等。基于这个性质我们首先进行自注意力机制来加强对静态物体的识别能力,即每一个时刻的特征还要累加上之前处理的所有的特征,如下面公式所示。而为了更加精确的感知动态物体,我们随后用3D卷积来进一步处理上述特征。

图片

感知输出的特征将与下一步的预测特征一起共同经过decoder头,根据中间表征结果进行监督。同时,我们也对深度估计部分进行显示监督,这思路也与最近的BEVDepth[6]等工作不谋而合。我们也将会开源我们通过其它额外网络训练用以监督的深度图。

预测模块(Dual Pathway Probabilistic Future Modelling)

图片

预测模块的Dual-GRU结构示意图

为了适应 BEV 空间中的代表性特征,我们将预测任务制定为未来场景的实例/语义分割,这与 FIERY[7]中的设定相同。类似FIERY的设计,我们首先将未来不确定性建模成高斯分布,并将其作为hidden state输入到时序模型中。但FIERY仅根据所有历史信息融合后的一个feature进行预测,而为了提高未来预测,我们需要更显示地考虑过去的运动变化,故本文引入一个具有融合单元的附加时间模型来推理过去和未来运动的概率性质。

path_a 用之前生成的不确定度作为输入且用当前时刻的状态作为隐状态,path_b 则用历史的特征作为GRU的输入,并且使用最早时刻的特征初始化隐状态。当预测t+1时刻的特征时,我们将两条线路预测的状态以混合高斯的形式进行混合,并将其作为下一时刻的输入。

最终生成的所有状态将会被送到各个decoder中生成不同的可解释中间表示,具体来说包含8个decoder头:

  • instance (centerness, offset, flow)

  • semantic (vehicle, pedestrian, drivable area, lanes)

  • cost volume

图片

预测模块的中间表征输出

规划模块(Prior Knowledge Incorporation and Refinement)

作为最终目标,运动规划器需要规划一条朝向目标点的安全舒适的轨迹。它根据high-level command采样一组不同的轨迹,并选择一条最小化代价的路径,其中cost分为(1)上一步通过学习得到的预测cost volume,(2)根据感知得到的场景表示人为设定的各项cost。且我们将通过额外的优化步骤来整合目标点和交通信号灯的信息。其图示过程如下:

图片

规划模块结构示意图

特别地,人为设定的cost function构造可充分利用先验知识,例如:

  • 安全性:轨迹不应与道路上其他agents相撞;在道路上车辆通常会跟随着前车并且保持着一定的安全距离;车辆应尽可能在道路中心行驶等。

  • 舒适性:会导致乘坐体验不适的较大的径向加速度或者侧向加速度都应具有较大的cost。

为了更好地将红绿灯情况纳入到轨迹生成的考虑中,我们将上一步选出来的具有最小成本的轨迹进一步细化。我们将encoder生成的前视摄像头的特征作为隐特征,轨迹和目标点作为输入输入到GRU中,通过这种方式最终细化后的轨迹能够较好的判断出红绿灯并且能够正确地导向目标点。

3实验结果

由于ST-P3具有显示的中间表征,我们可以将每个模块解码出的结果与其它相应方法进行比较,其中感知与预测模块在nuScenes上比较,最终的规划结果分为nuScenes上的开环任务与CARLA仿真环境中的闭环任务比较。

感知模块结果

对于感知模块而言,我们主要评估地图模块和语义分割的结果。感知到的地图包括可行驶区域和车道线——这是驾驶行为的两个最关键的元素,因为SDV需要在可行驶区域内行驶并保持在车道中心。而语义分割侧重于车辆和行人,两者都是驾驶环境中的主要参与人。我们使用 IoU作为度量,将感知模块建模为 BEV 分割任务。如下表格所示,我们的方法在nuScenes验证集上取得了最高的平均值,使用我们的感知模块超过了之前的SOTA。

图片

感知模块输出结果比较

预测模块结果

在FIERY文章中首次提出预测 BEV 中的未来分割任务,我们选择它作为我们的baseline。我们通过 IoU、现有全景质量 (PQ)、识别质量 (RQ) 和分割质量 (SQ) 来评估我们的模型,这些指标遵循视频预测区域中的指标。由下表可知,由于预测模块的新颖设计,我们的模型在所有指标中达到了最优秀的水平。

图片

预测模块输出结果比较

最终规划结果

可以看到,我们的ST-P3在开环nuScenes数据集和闭环CARLA上都取得了当前基于视觉方法下的最好结果。注意到在闭环实验中,我们的方法在长程情况下在道路完成率上远远领先基于LiDAR方法的Transfuser,虽然另一方面长距离的运动导致了更高的惩罚系数,总体来看ST-P3的设计符合道路行驶条件。

图片

规划(nuScenes开环,CARLA闭环)结果比较

Ablation分析

下表格显示了 ST-P3 中不同模块的有效性。

  • Exp.1-3 展示了深度监督信息和以特征累积(EAA.)对感知的影响。

  • Exp.4-6 展示了双路GRU和相应的训练方式(对所有历史状态计算损失,LFA.)对预测任务的影响。由于双路GRU同时考虑了不确定性和历史连续性,因此过去特征的正确性在其中起着至关重要的作用。

  • Exp.7-9 则显示了规划中的采样器和 GRU 细化单元的作用。没有前视相机特征refinement(Exp.7)或没有先验采样知识的隐式模型(Exp.8)都会导致较高的规划误差和碰撞率。

图片

各模块消融实验

4可视化结果

下面展示nuScenes和CARLA上的可视化结果,更多的结果可以参考补充材料~

图片

nuScenes转弯场景

图片

CARLA测试躲避行人场景

5下一步工作

总体来说,ST-P3作为第一个中间结果显示设计的环视端到端自动驾驶网络,还是较为基础的。同时我们的结果表明更好的中间结果表示对于最终规划的精度提高有着重要的重要,证明了端到端设计最终结果的精度同样依赖于中间结果的精度,这启发着我们进一步提高中间结果的精度。近期随着BEV vision learning任务的兴起与流行,我们相信这些工作带来的更好的感知/预测结果也能带来在端到端任务上的性能提升。同时为了实现最终模型的部署应用,多帧环视输入模型的速度也需要进一步地提高。

6参考

  1. ^https://arxiv.org/abs/2101.06679

  2. ^https://arxiv.org/abs/2008.06041

  3. ^https://arxiv.org/abs/2008.05930

  4. ^https://arxiv.org/abs/2101.06806

  5. ^https://arxiv.org/abs/2008.05711

  6. ^https://arxiv.org/abs/2206.10092

  7. ^https://arxiv.org/abs/2104.10490

独家重磅课程官网:cvlife.net

图片

全国最大的机器人SLAM开发者社区

图片

技术交流群

图片

【CCF计算领域学术会议介绍:2024日程安排、CCF会议deadline汇总、2022年录用率】 CCF计算领域学术会议介绍:2024日程安排、CCF会议deadline汇总、2022年录用率 阅读详情

相关推荐

告别激光雷达?手把手复现ST-P3:一个纯视觉的端到端自动驾驶模型(附避坑指南)

本文详细介绍了如何从零复现ST-P3这一纯视觉端到端自动驾驶模型,包括环境配置、数据处理、模型架构解析及训练优化技巧。ST-P3通过创新的时空特征学习机制,在nuScenes和CARLA基准测试中展现出媲美激光雷达方案的性能,为低成本自动驾驶提供了新思路。文章还提供了TensorRT加速和轻量化改进等实战经验。

weixin_30500105的博客 40

ST-P3开源项目教程

ST-P3开源项目教程 1. 项目介绍 ST-P3是由OpenDriveLab开发的一个高级开源项目,旨在提供一个高效的解决方案来处理时空数据处理和分析任务。该项目利用先进的深度学习技术,专注于改善地图增强、自动驾驶车辆的数据处理能力以及交通状况的预测。通过ST-P3,开发者能够构建更加智能的驾驶环境感知系统,优化路径规划及提高道路安全性能。 2. 项目快速启动 为了快速启动ST-P3项目,首先确...

gitblog_00903的博客 1238

51c自动驾驶~合集57

多目标多头蒸馏模块:我们看到轨迹模仿学习之后的轨迹还过了其他的MLP,这就是其他头,它的目标也是不一样的,第一个是跟碰撞相关的,第二个是跟行驶区域相关的,第三个是跟舒适度相关的,也就是说不同的评判指标都有一个teacher,之前的模仿学习就是人类的teacher,那么这些teacher是怎么来的呢?本文作者提出的新的范式,就是规划模块是多模的输出,同时,目标也是多样性的,即不仅是GT的轨迹也同时引入了更多的正样本,由不同的专家给出的。还是那句话,小米汽车的成功,是小米价值观,小米模式,和小米方法论的成功。

whaosoft~aiotの开发板商城 2200

【亲测免费】 ST-P3:基于视觉的端到端自动驾驶框架

ST-P3:基于视觉的端到端自动驾驶框架 1. 项目基础介绍 ST-P3 是一个由 OpenDriveLab 开发的端到端视觉自动驾驶框架,该框架通过空间时间特征学习来实现自动驾驶中的感知、预测和规划任务。项目主要使用 Python 编程语言,并借助 PyTorch Lightning 框架进行实现。 2. 项目核心功能 ST-P3 的核心功能是提出了一种空间时间特征学习方案,该方案旨在为自动驾驶...

gitblog_00512的博客 675

ST-P3首篇基于环视相机端到端自动驾驶框架!(ECCV2022

作者|PerceptionX 编辑|汽车人原文链接:https://zhuanlan.zhihu.com/p/544387122点击下方卡片,关注“自动驾驶之心”公众号ADAS巨卷干货,即可获取论文地址: https://arxiv.org/abs/2207.07601项目地址: https://github.com/OpenPerceptionX/ST-P37...

CV_Autobot的博客 1949

BEVFormer【人工智能

Temporal Self-Attention模块用于捕捉时间序列上的运动信息,Spatial Cross-Attention模块用于学习不同视角的特征之间的关系。该算法通过提取环视相机(Bird’s Eye View Camera)采集到的图像特征,并通过模型学习的方式将这些特征转换到BEV空间(Bird’s Eye View),从而实现对目标的检测和分割,并且在实验证明其具有优越的性能。通过匈牙利匹配,将BEV中的ground truth与预测框进行匹配,得到每个预测框的分类标签和位置目标。

m0_73916791的博客 1176

自动驾驶&占用网格预测

⭐[ECCV 2024] SparseOcc 纯稀疏3D占用网络和 RayIoU 评估指标 SparseOcc纯稀疏占用网络论文笔记(南大/上海AI LAB) 3D Occupancy 探索V1.0 - T-MAC的文章 - 知乎 最新综述!一览Occ与自动驾驶的前世今生,首篇综述全面汇总特征增强/量产部署/高效标注三大主题综述 Awesome-3D-Occupancy-Prediction Awesome-occupancy-perception Awesome-Occupancy-Prediction-

qq_35975367的博客 956

LSS核心算法与代码详细解读 -最全攻略

对于每个相机,将每个图像单独“Lift”成一个特征截锥。然后将所有的截锥“Splat”到鸟瞰网格中。

wtj318_的博客 2191

ECCV2022 | BEVFormer

这六个方面完成 BEVFormer 的解析;

usernameisnotexist的博客 501

PETR- Position Embedding Transformation for Multi-View 3D Object Detection

目标:环视相机的2D特征,加3D位置编码,转成3D表征。纯视觉BEV方案transformer网络3D检测。旷视 ECCV 2022

m0_37663482的博客 643

论文赏析 ▎BEVFormer,提出了一种采用纯视觉做感知任务的算法模型

BEVFormer 是今年中稿 ECCV 2022 的一篇论文。该篇论文提出了一个采用纯视觉(camera)做感知任务的算法模型 BEVFormer。BEVFormer 通过提取环视相机采集到的图像特征,并将提取的环视特征通过模型学习的方式转换到 BEV 空间(模型去学习如何将特征从 图像坐标系转换到 BEV 坐标系),从而实现 3D 目标检测和地图分割任务,并取得了 SOTA 的效果。

auto_mooc的博客 658

经典回顾!LSS (Lift, Splat, Shoot) 论文&源码万字长文解析

作者|Fangzh 编辑|汽车人原文链接:https://zhuanlan.zhihu.com/p/589146284点击下方卡片,关注“自动驾驶之心”公众号ADAS巨卷干货,即可获取点击进入→自动驾驶之心【多传感器融合】技术交流群后台回复【多传感器融合综述】获取图像/激光雷达/毫米波雷达融合综述等干货资料!论文研究背景LSS是一篇发表在ECCV 2020上有关自动驾驶感知方向的论文,具体...

CV_Autobot的博客 6422

论文reading学习记录3 - weekly - 模块化视觉端到端ST-P3

题目:ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning2022年的视觉端到端论文。ego-motion:自身运动真的好难 :(提出了一种联合时空特征学习的端到端方法,明确设计网络中的中间表示提出了一种以自我为中心的对齐累积技术,在鸟瞰图转换之前保留3D空间中的几何信息以进行感知。双路径建模,以考虑过去的运动变化,用于未来的预测。

weixin_42690036的博客 1192

端到端自动驾驶前沿论文盘点(pdf+代码)

现在的自动驾驶,大多数还是采用的模块化架构,但这种架构的缺陷十分明显:在一个自动驾驶系统里,可能会包含很多个模型,每个模型都要专门进行训练、优化、迭代,随着模型的不断进化,参数量不断提高,所需的研发人员也跟着涨,研发成本自然居高不下。而端到端架构的优势在于,只通过一个模型就实现了以上多种模型的功能,因此我们只需要调整训练这一个模型,就能大大提高性能,这让我们可以更好地集中资源,实现功能聚焦。为此,端到端架构的研究一直是自动驾驶领域的热门方向,我这次也收集整理了。

学姐带你玩AI的博客 3109

入行端到端自动驾驶,今年必读的十篇最前沿论文

点击下方卡片,关注“自动驾驶之心”公众号戳我->领取自动驾驶近15个方向学习路线今天自动驾驶之心为大家分享十篇端到端论文的汇总,入门自动驾驶必读!如果您有相关工作需要分享,请在文末联系我们!自动驾驶课程学习与技术交流群事宜,也欢迎添加小助理微信AIDriver004做进一步咨询>>点击进入→自动驾驶之心『端到端自动驾驶』技术交流群论文作者|禾呈三金编辑 | 自动驾驶之心En...

CV_Autobot的博客 7687

探索未来驾驶:ST-P3 —— 空间时间特征学习驱动的端到端自动驾驶系统

探索未来驾驶:ST-P3 —— 空间时间特征学习驱动的端到端自动驾驶系统 项目地址:https://gitcode.com/gh_mirrors/st/ST-P3 在这个数字化的时代,自动驾驶技术正逐步引领着交通行业的未来。今天,我们向您推荐一个创新的开源项目——ST-P3(Spatial-Temporal Feature Learning for Perception, Prediction, ...

gitblog_00006的博客 819

自动驾驶合集3

当我们观察上面的表4,会看到我们的方法Baseline(ID-10)在不使用任何ego status的信息的情况下,可以取得和UniAD(ID-2), VAD(ID-5)这些在BEV上用了ego status的,使用了额外感知,预测任务的模型差不多的效果。与之对比的是模型会过渡依赖Ego Status的信息,假如我们改变输入模型的速度,会发现模型预测的轨迹基本会按照我们输入的假的速度去走,哪怕输入图像中事实上隐式地包含了ego的真实速度。如图2所示,为了区分,将我们复现的这个网络记为Ego-MLP。

whaosoft143ai的博客 740

值得收藏!2024年人工智能顶级会议投稿信息汇总(计算机视觉领域)

本文对计算机视觉领域内的顶级会议进行了介绍,以便读者了解会议主题、截稿日期、录用通知时间、举办时间及地点等关键信息。同时还将相关会议信息汇总成一张表格,方便读者快速的查看计算机视觉领域内的相关论文。

audyxiao001的博客 2万+
上一篇: ECCV 2022 | 清华&腾讯AI Lab提出REALY: 重新思考3D人脸重建的评估方法
下一篇: 面试20场,我总结了面试问题及解答!激光+IMU融合定位方向
计算机视觉life
博客等级 码龄12年 4318粉丝 · 209原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值