使用Transformer融合时空信息的自动驾驶感知框架

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

在这里插入图片描述

BEVFormer很荣幸参与到最近这波BEV感知的研究浪潮中,我们从开源社区中受益良多,也希望尽我们所能为社区做出我们自己的贡献,希望未来与社区一道共同构建更加安全可靠的自动驾驶感知系统。

引言

TL; DR: 本文提出了一套基于Transformer和时序模型在鸟瞰图视角下优化特征的环视物体检测方案,即BEVFormer。nuScenes数据集上以NDS指标(类似mAP),在camera only赛道中大幅领先之前方法。本文旨在介绍我们在设计BEVFormer过程中考虑的思路、比较的多种方法、以及下一步可能的研究方向。

PS:未经授权,禁止转载

介绍

最近,基于多视角摄像头的3D目标检测在鸟瞰图下的感知(Bird’s-eye-view Perception, BEV Perception) 吸引了越来越多的注意力。一方面,将不同视角在BEV下统一与表征是很自然的描述,方便后续规划控制模块任务;另一方面,BEV下的物体没有图像视角下的尺度(scale)和遮挡(occlusion)问题。如何优雅的得到一组BEV下的特征描述,是提高检测性能的关键。

nuScenes自动驾驶数据集因其数据的质量、规模与难度都比之前数据集有大幅提升,而获得了很多研究者的关注。在nuScenes 3D object detection task上,目前前6名方案都是2022年3月进行的提交。我们提出的BEVFormer取得了48.1 mAP和56.9 NDS,两个指标均超越现有方法3个点以上,暂列第一。“低碳版”BEVFormer-pure仅使用ResNet-101与单尺度测试,取得了优于第二名(Swin-B、test-time aug)的mAP以及相同的NDS。具体榜单如下。
在这里插入图片描述
注:Table:BEVFormer 在nuScence榜单上的排名(截至2022.3.31)

本项目最早启发于2021年7月特斯拉的技术分享会,为此我们还做了几期细致的分享(链接TODO)。特斯拉展示了基于Transformer使用纯视觉输入进行自动驾驶感知任务的惊艳效果,但是它并没有展示其方法的具体实现和量化指标。与此同时,学术界也有许多相关工作旨在利用纯视觉输入来完成自动驾驶感知任务,例如3D目标检测或者构建语义地图。我们提出的BEVFormer的主要贡献在于使用Transformer在BEV空间下进行时空信息融合

BEVFormer方案

在这里插入图片描述
注:BEVFormer动机:使用可学习的BEV query通过attention与spatial space 和temporal space交互

动机

在介绍BEVFormer的具体方案之前,先要回答两个问题。

1: 为什么要用BEV?

事实上对于基于纯视觉的3D检测方法,基于BEV去做检测并不是主流做法。在nuScenes 榜单上很多效果很好的方法(例如

【CV论文精读】【BEV感知】BEVFormer:通过时空Transformer学习多摄像机图像的鸟瞰图表示 3D视觉感知任务,包括基于多摄像头图像的3D检测和地图分割,对于自动驾驶系统至关重要。在这项工作中,我们提出了一个称为BEVFormer的新框架,它通过时空Transformer学习统一的BEV表示,以支持多个自动驾驶感知任务。简而言之,BEVFormer通过预定义的网格形状的BEV queries与空间和时间进行交互,从而利用空间和时间信息。为了聚集空间信息,我们设计了空间交叉注意力,每个BEV query从跨摄像机视图的感兴趣区域中提取空间特征。 阅读详情

相关推荐

BEVFormer 纯视觉3D检测实战:nuScenes数据集上NDS 56.9%复现与调优指南

本文详细介绍了BEVFormer在nuScenes数据集上实现56.9% NDS指标的纯视觉3D检测实战指南。从环境搭建、数据处理到模型训练与调优,提供了全面的复现步骤和性能优化技巧,帮助开发者掌握这一自动驾驶领域的突破性技术。

weixin_29053577的博客 308

【BEV】BEVFormer总结

【BEV】BEVFormer总结

m0_51579041的博客 2137

Transformer系列论文】TransFuser:端到端自动驾驶的多模态融合Transformer

Article 作者:Aditya Prakash, Kashyap Chitta, Andreas Geiger 文献题目:TransFuser:端到端自动驾驶的多模态融合Transformer 文献时间:2021 文献链接:https://arxiv.org/abs/2104.09224 摘要 互补传感器的表征应该如何集成到自动驾驶中?基于几何的传感器融合在物体检测和运动预测等感知任务中显示出巨大的前景。然而,对于实际驾驶任务,3D 场景的全局上下文是关键,例如交通灯状态的变化会影响几何上远离交通

qq_43058281的博客 7354

Transformer在BEV感知中的统治地位

Transformer在BEV感知中的统治地位 ,人工智能,计算机视觉,大模型,AI,本文围绕 Transformer 在 BEV 感知中的统治地位展开,介绍了 Transformer 的基础原理,如自注意力、多头注意力机制等,以及 BEV 感知的概念、任务与挑战。阐述了 Transformer 在 BEV 感知中的技术优势,包括全局建模、灵活特征融合和长距离依赖捕捉能力,还介绍了典型架构、代码示例及在自动驾驶目标检测等领域的应用案例。同时,评估了其性能,提及优化方法,并展望了与其他技术融合、端到端系统等…

不踩坑,不知道坑有多深;不总结,踩过的坑白踩。 20万+

BEVFormer论文详细解读

1.相当于我们在上帝视角下重构了一个特征空间,空间的大小我们自己定义 2.特征空间相当于一个网格,网格的间隔也可以自己定义,对应精度也会有差异 3.在特征空间中,我们可以以全局的视角来进行预测,特征都给你了,咋用你来定 4.难点:既想做的细致,还想节约计算成本,怎么办?BevFormer它来了

AI人工智能的海洋 8276

BEV专栏(一)从BEVFormer深入探究BEV流程(上篇)

本文提出了一种基于Transformer和时间结构的Bird's-Eye-View(BEV)编码器,称为BEVFormer。该编码器可以有效地聚合来自多视角摄像机和历史BEV特征的时空特征。

CV技术指南(微信公众号) 2323

BEVFormer:基于Transformer自动驾驶BEV纯视觉感知

作者 | 李志琦单位 | 南京大学/上海人工智能实验室研究方向 | 基于注意力机制的视觉感知BEVFormer 很荣幸参与到最近这波 BEV 感知的研究浪潮中,我们从开源社区中受益良多,也希望尽我们所能为社区做出我们自己的贡献,希望未来与社区一道共同构建更加安全可靠的自动驾驶感知系统。引言TL; DR:本文提出了一套基于 Transformer 和时序模型在鸟瞰图视角下优...

Paper weekly 1万+

智慧交通沙盘小车实现自动驾驶BEV Transformer感知

在博文“智慧交通沙盘小车实现自动驾驶BEV Transformer感知”中,探讨了如何利用BEV Transformer技术和高级传感器,如激光雷达、摄像头、UWB定位系统等,来实现自动驾驶微缩小车在模拟城市环境中的精准感知。这种技术的应用不仅展现了自动驾驶领域的前沿进展,而且在教育上具有重要意义。通过实际操作模拟车辆,学生能深入理解自动驾驶系统的复杂性,激发对智能网联、机器人学等相关专业的兴趣,为未来在这一领域的职业生涯打下坚实的基础。

渡众机器人 2613

【三维感知目标检测论文阅读】《3D Object Detection for Autonomous Driving: A Comprehensive Survey》

VoxelNet 和 PointPillars 是里程碑式的工作,它们通过将点云规则化,从而可以应用高效的卷积网络进行处理,在速度和精度之间取得了很好的平衡。这篇综述最棒的地方之一,就是它提供了一个非常清晰的层次化结构图(论文中的Figure 1),几乎涵盖了3D目标检测的所有方面。这是目前研究的热点,融合的方式也多种多样,从简单的拼接到复杂的注意力机制和Transformer。这篇综述系统地梳理了自动驾驶3D目标检测领域的各项技术,无论是刚入门的小白,还是想深入了解最新进展的老手,都能从中获益匪浅。

weixin_42479402的博客 2538

大盘点!自动驾驶中基于Transformer的单目BEV感知

点击下方卡片,关注“自动驾驶之心”公众号ADAS巨卷干货,即可获取今天自动驾驶之心很荣幸邀请到Garfield,为大家分享自动驾驶中基于Transformer的单目BEV感知!如果您有相关工作需要分享,请在文末联系我们!>>点击进入→自动驾驶之心【BEV感知】技术交流群后台回复【3D检测综述】获取最新基于点云/BEV/图像的3D检测综述!基于多视角摄像头的3D目标检测在鸟瞰图下的感知(...

CV_Autobot的博客 2512

基于Transformer的BEV感知自动驾驶新范式详解

自动驾驶的核心挑战之一是感知——让机器像人类一样理解周围环境。传统感知系统依赖单目/双目相机、雷达等传感器的2D/3D数据,但存在视角盲区、多模态融合困难等问题。BEV(鸟瞰图,Bird’s-Eye View)感知作为一种“上帝视角”的解决方案,能将多传感器数据统一到俯视坐标系中,实现全局环境理解。而的出现,彻底重构了BEV感知的技术范式:其自注意力机制能高效融合多模态特征,端到端学习框架能优化整体感知性能。本文将从背景痛点。

AI架构师小马 1659

自动驾驶感知中多模态融合方法

自动驾驶感知中多模态融合方法

qq_51745206的博客 1531

自动驾驶环境感知性能优化(基于Transformer的BEV感知方案全面拆解)

提升自动驾驶环境感知性能,详解基于Transformer的BEV感知方案。面向城市场景复杂路况,融合多摄像头数据实现360度实时感知,显著提升检测精度与推理速度。深入拆解算法架构与优化策略,助力自动驾驶Agent的环境感知系统升级,值得收藏。

CodeWhim的博客 1200

TransFuser完整指南:基于Transformer自动驾驶传感器融合技术深度解析

自动驾驶系统面临的核心挑战之一是如何有效整合来自不同传感器的异构数据,实现精准的环境感知与决策。传统的传感器融合方法往往依赖手工设计的特征和复杂的规则系统,难以应对复杂多变的真实道路环境。TransFuser作为一项突破性的研究成果,通过基于Transformer架构的**多模态传感器融合**技术,为**端到端自动驾驶**提供了一种全新的解决方案。 ## 🚗 传统自动驾驶系统的技术瓶颈 传统

gitblog_00853的博客 1096

BEV+Transformer:多模态数据融合如何重塑自动驾驶感知边界?

BEV+Transformer技术通过将多传感器数据统一到鸟瞰图坐标系,并结合Transformer的自注意力机制,实现了自动驾驶感知范式的根本转变。该方案以多传感器数据融合为核心,提供全局、统一的3D场景理解,显著提升了在复杂路况、恶劣天气及极端场景下的感知能力与安全性。

536

代季峰对话张祥雨 | 自动驾驶感知新时代!新一代环视感知算法BEVFormer有哪些优势...

导读:Elon Musk说过,“人类不是超人,也不是蝙蝠侠,不能够眼放激光,也不装有雷达,但是通过眼睛捕捉到的图像,人类依旧可以构建出对周围世界的3D空间理解能力,从而很好地掌握驾驶这项能力。”想要真正实现自动驾驶,让汽车具备像人类司机一样的感知能力最为关键。在去年的特斯拉 AI Day上,Karparthy展示了基于Transformer的BEV(Bird's eye ...

BAAIBeijing的博客 2586

自动驾驶场景下的多模态融合:BEV、Transformer、Occupancy 网络要点解析

BEV+Transformer+OccupancyNetwork技术正推动自动驾驶感知系统从目标识别向场景理解升级。BEV提供统一的鸟瞰视角空间表达,消除传感器数据差异;Transformer实现跨模态和时序的特征融合;OccupancyNetwork通过体素化建模空间占用状态,有效应对异形障碍和遮挡问题。三者协同构建了多模态、时序一致的3D/4D感知空间,显著提升复杂场景下的环境理解能力。未来,该技术组合将向端到端系统、轻量化和4D时空预测方向发展,为自动驾驶提供更接近人类的环境理解能力。

2501_91624122的博客 1570

自动驾驶感知新范式——BEV感知经典论文总结和对比(一)

关于自动驾驶视觉感知,最近两三年另外一个热门方向便是更为直接的bev视角下的视觉感知。不同于深度估计先显式获取各个像素点的深度,再支持其他相关任务,bev视角下可以实现端到端的目标检测、语义分割、轨迹预测等各项任务。由于这种方法pipline更加简单直接,且能够更好地被下游规控所使用(在同一个坐标系),近期相关研究工作达到井喷趋势,霸占各大SOTA榜单。现按照大致发展顺序介绍一系列经典模型,帮助感兴趣的小伙伴快速了解相关内容。

liuphahaha的专栏 3294
上一篇: TCP:结合轨迹规划和控制预测的端到端自动驾驶框架
下一篇: 上海人工智能实验室自动驾驶团队校招进行中!
OpenDriveLab
博客等级 码龄4年 10粉丝 4原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值