25年6月来自理想汽车的论文“DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models”。
视觉-语言-动作 (VLA) 模型推动了自动驾驶的发展,但现有基准测试仍然缺乏场景多样性、可靠的动作级标注以及符合人类偏好的评估方案。为了突破这些限制,本文推出 DriveAction,专为 VLA 模型设计的动作驱动基准测试,包含 2,610 个驾驶场景生成的 16,185 个问答对。DriveAction 利用量产自动驾驶汽车用户主动收集的真实驾驶数据,确保场景覆盖范围广泛且具有代表性;提供直接从用户实际驾驶操作中收集的高级离散动作标签;并实现了一个以动作为根的树状结构评估框架,该框架将视觉、语言和动作任务明确关联,支持综合评估和针对特定任务的评估。实验表明,最先进的视觉-语言模型 (VLM) 需要视觉和语言的共同引导才能实现准确的动作预测:平均而言,在没有视觉输入的情况下,准确率下降 3.3%,在没有语言输入的情况下,准确率下降 4.1%,而两者都没有的情况下,准确率下降 8.0%。
驾驶员-贡献的宽广覆盖驾驶场景
如表的“来源”列所示,DriveAction 汇总了量产汽车自动驾驶系统用户收集的真实数据,这与以往依赖自主收集或开源数据的基准测试截然不同。该数据集覆盖中国 148 个城市,涵盖公司部署的所有量产汽车记录。为了确保收集的驾驶场景和操作全面且具有代表性,进行多轮人工筛选和质量控制。

下表总结了 DriveAction 中的七个关键场景类别,并为每个类别配备了代表性操作和简明描述,以说明覆盖范围和注释策略。这些场景涵盖了广泛的真实驾驶条件,包括匝道和辅路的并道/分道,以及导航和效率驱动的变道。其覆盖范围超越了典型的城市、高速公路和混合交通环境,涵盖了复杂的路口、施工区域、拥堵以及与弱势道路使用者的互动等挑战性场景。每个场景都与各种细粒度的操作相关联,例如变道、减速和绕行操作,从而能够对各种驾驶情况下的决策进行详细分析。

与人类驾驶偏好一致的真值
DriveAction 直接从真实的用户驾驶操作中获取操作标签,从而能够准确、实时地捕捉驾驶员的意图和决策。这与之前的基准测试形成了鲜明对比,之前的基准测试依赖于手动或开源注释,如第一个表的“标签”列所示。
DriveAction 采用离散化的高级操作作为真值,这与端到端大型模型的输出粒度相匹配,能够更好地反映人类驾驶决策的多样性和分类性。例如,在变道场景中,DriveAction 不再依赖高频采样的密集轨迹,而是捕捉关键点的决策——例如是否启动变道以及行驶方向——从而更好地匹配大型模型的低决策频率。这种设计为当前的自动驾驶模型提供了更合适、更公平的评估标准。
为了确保动作标签的可靠性和有效性,所有数据都经过多轮人工验证,并排除错误、不合理或违规行为的实例。具体而言,这些行为包括意外的控制输入(例如错误加速或转向)、与交通环境不符的行为(例如无障碍物突然停车)以及违反交通规则的行为(例如穿越实线车道)。
基于动作的树状结构评估
为了建立一个能够紧密反映真实驾驶决策过程的评估框架,并在整个决策流程中系统地评估自动驾驶模型,在 DriveAction 中提出一个基于动作的树状结构评估架构。该框架采用以动作为根基、以动作决策为核心的层级结构设计,将复杂的驾驶动作动态映射到所需的视觉和语言任务。通过整合丰富的上下文场景信息,该框架确保模型决策在完整且真实的环境中进行。此外,该评估系统设计高度灵活,既支持全面的视觉-语言-动作模型 (V-L-A)评估,也支持针对特定任务的评估,从而能够满足各种模型功能和评估需求。
任务定义
上述第一个表比较了 DriveAction 与现有基准测试集的评估逻辑。大多数现有基准测试集要么缺乏明确的评估逻辑链,要么即使存在,也采用基于链或图的结构。DriveAction 率先引入以动作为根基的树形结构框架作为其评估逻辑。通过利用动作驱动的树形依赖关系,评估范式将 V-L-A 任务系统地集成到一个可扩展的框架中。这允许根据每个动作动态组合子任务,即使在复杂或长尾场景中也能进行全面的决策评估。这样的结构大大增强了基准的表现力和面向未来的适用性。
如图展示了 DriveAction 的树状任务架构。该架构以动作空间为根,明确定义每个动作所需的语言任务,并进一步将每个语言任务映射到其依赖的视觉任务。该层级结构分为三层:顶层由动作节点组成,例如变道和交叉路口转弯,代表模型的最终决策输出。中间层由语言任务组成,例如导航跟随和红绿灯跟随,为每个动作提供场景理解。底层由视觉任务组成,负责检测和识别关键环境要素,例如车道、交通标志和障碍物。虽然评估框架被建模为从动作向下的依赖树,但底层模型推理仍然遵循传统的 V-L-A 顺序。这种设计提供了系统化且有针对性的评估结构,从而与现实世界自动驾驶系统的信息流和推理过程紧密相关。

DriveAction 包含 14 个独立任务,其中包括 7 个视觉任务和 7 个语言任务,涵盖了现实世界驾驶中遇到的各种场景。所有任务均采用问答 (QA) 形式进行评估,问答形式为成对的问题和答案,包含选择和判断两种模式。下图展示了 QA 在视觉、语言和动作层面的分布,确保 VLA 层级结构的每一层都具有充分且具有代表性的覆盖范围。例如,转弯动作占了很大一部分,这与它们在实际驾驶场景中相对较高的频率相符。这种分布确保评估涵盖常见和不常见情况,为评估模型性能提供了有意义的基础。

下图以交通标志任务为例,展示了 DriveAction 中完整的 V-L-A 评估流程。该流程始于交通标志检测,模型需要识别每个标志的存在及其类型。成功检测后,模型必须判断该标志是否与当前驾驶环境及其自身行为相关。如果确定交通标志具有实际影响,则模型有望据此做出适当的驾驶决策。通过这套 V-L-A 流程,DriveAction 全面评估模型从低级感知到高级理解,并最终实现明智决策的能力。

场景信息设计
DriveAction 将关键场景背景融入到每个评估提示中,确保模型在现实且具有代表性的条件下进行评估,并减少无依据或幻觉推理。具体而言,DriveAction 提供三种类型的场景信息:
• 连续视觉帧:为模型提供在决策前立即捕捉的三个连续视觉帧,从而支持动态情境中的时序推理。
• 导航指令:这些指令直接来自车载导航系统,提供关键的路线指引、即将到来的转弯和目标车道信息,从而明确决策目标和路径规划指南。
• 车速:从车载传感器获取的车辆自速度和目标车速量化了当前和期望的驾驶状态。这些动态信息无法仅凭图像推断,对于在变道、超车或加速时做出合理的决策至关重要。
为了评估场景信息的效果,在两种情况下(有和无导航指令)在交叉路口前进行了变道任务。如下图所示,当导航指令明确指示即将右转时,模型能够提前准确地选择正确的变道动作;而当导航指令缺失时,模型通常会做出与实际驾驶目标不符的“幻觉”决策。这凸显了提供关键场景信息对于可靠且情境感知的自动驾驶评估的重要性。

灵活的评估模式
VLA 模型的架构要求评估方法不仅要评估整体端到端性能,还要评估单个任务的有效性。为此,DriveAction 引入了一种灵活的评估机制,支持综合评估和特定任务的评估。这样能够分析视觉和语言信息如何影响整体行动决策,并有助于识别单个任务中的模型瓶颈。
综合评估侧重于模型的最终决策输出,其中来自上游任务的 QA 对作为行动决策的已知信息依次引入。支持四种评估模式:
• 全流程模式 (V-L-A):提供来自视觉 (V) 和语言 (L) 任务的 QA 对,在完全知情的条件下评估行动绩效。
• 纯视觉模式 (V-A):仅提供来自视觉任务的 QA 对,不提供高级语言信息,因此主要基于视觉感知来评估行动。
• 纯语言模式 (L-A):仅提供来自语言任务的问答对,不提供高级视觉信息,因此主要基于语言理解来评估操作。
• 无信息模式 (A):不注入上游问答信息,仅提供基本场景和任务要求。此模式评估模型在没有高级外部指导的情况下,仅依赖内部推理和现有知识做出合理决策的能力。
通过分析和比较这四种模式下的结果,该框架可以系统地揭示模型对不同模态的依赖程度、泛化能力和推理能力,从而支持对自动驾驶决策机制的深入分析。
针对分层树状结构中的每个节点进行针对特定任务的评估,从而对模型能力进行细粒度的评估。这种方法能够深入了解模型在感知、推理和决策能力方面的优势和劣势,例如车道检测和交通信号灯识别(视觉任务)、导航跟踪和交通规则理解(语言任务),以及具体的驾驶操作,例如变道和交叉路口转弯(行动任务)。综合评估衡量的是整体决策能力,而特定任务评估则能精准定位各个组件的性能。两者结合,可以全面展现模型的功能。
实验设置
本文评估 12 个广泛采用的 VLM,分为非推理和推理两类。非推理模型直接基于输入生成答案,无需明确的中间推理,包括 GPT-4o [38]、GPT-4o mini [39]、GPT-4.1 [40]、GPT-4.1 mini [40]、Claude 3.5 Sonnet [41]、Claude 3.7 Sonnet [42] 和 Qwen-Max-Latest [43]。推理模型采用循序渐进的思维链过程进行复杂推理,并生成更接近人类的答案,包括 o1 [44]、o3 [45]、Claude 3.7 Sonnet Thinking [42]、Doubao-1.5-vision-pro-32k [46] 和 Gemini 2.5 Pro [47]。模型性能通过所有问题类型(包括选择任务和判断任务)的准确率来衡量。所有实验均使用 VLMEvalKit [60] 实现。
综合评估
下表展示了四种评估模式下的模型准确率:全流程模式 (V-L-A)、纯视觉模式 (V-A)、纯语言模式 (L-A) 和无信息模式 (A)。这项综合评估旨在探究视觉和语言信息的获取如何影响自动驾驶中的最终行动决策。

总体而言,所有模型在全流程模式 (V-L-A) 下的准确率最高,在无信息模式 (A) 下的准确率最低。值得注意的是,移除视觉或语言模态都会导致性能持续下降。结果表明,最先进的 VLM 需要视觉和语言的共同指导才能做出最佳决策:平均而言,在没有视觉输入的情况下,准确率下降 3.3%,在没有语言输入的情况下,准确率下降 4.1%,在没有两者的情况下,准确率下降 8.0%。
仔细比较不同的模型,可以发现其趋势与其预期设计基本一致。推理模型通常优于非推理模型,尤其是在 V-L-A 模式下,诸如 o1 [44] 和 o3 [45] 之类的模型取得了最高的优势,但这种优势并不总是成立。在 A 模式下,一些非推理模型的表现与推理模型相当,甚至更好。

8444

被折叠的 条评论
为什么被折叠?



