【多模态】|CVPR2024|ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts

ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
ViP-LLaVA:使大型多模态模型理解任意视觉提示
作者来源:威斯康星大学麦迪逊分校

摘要:

尽管现有的大型视觉-语言多模态模型主要关注整体图像理解,但在实现区域特定理解方面仍存在明显短板。当前使用文本坐标或空间编码的方法往往难以提供直观的视觉提示交互界面。为解决这一难题,我们提出了一种新型多模态模型,能够解码任意(自由形式)的视觉提示。该模型允许用户通过直观标记图像,并使用“红色边界框”或“带箭头指示”等自然提示与模型互动。我们的简洁设计直接在RGB图像上叠加视觉标记,无需复杂区域编码,却在Visual7W、PointQA和Visual Commonsense Reasoning等基准测试中取得了顶尖表现。此外,我们还推出了ViP-Bench综合评估体系,用于多维度评估模型理解视觉提示的能力,为该领域未来研究奠定基础。相关代码、数据和模型均已公开。

  1. Introduction

诸如ChatGPT[32]、GPT4[33]和Bard[12]等大型语言模型,凭借强大的推理能力、泛化能力和拟人化对话能力,近期备受关注。特别是融合视觉信息的GPT-4V(视觉)[31]等模型,已展现出人类水平的感知与推理能力[50]。这推动了同类开源模型的开发,这些模型致力于复制甚至超越专有模型的性能。
尽管具备这些能力,但当前模型(包括LLaVA[23,24]和MiniGPT-4[56]等开创性模型)仍主要聚焦于整体图像理解,换句话说,它们缺乏处理复杂场景中特定区域信息的能力。这种局限性在仅通过语言提示描述图像中特定物体时尤为明显,当存在歧义时(例如图像中有多个对象且问题涉及特定个体时),这种描述会变得困难,如图1所示。
为解决这一问题,近期研究开始探索多模态模型中的空间参考机制。现有研究主要集中在使用坐标文本表示[4,5,9,53]、学习位置嵌入[34,52,55]或感兴趣区域特征[37,52]。然而这些方法往往不够用户友好,因为它们受限于固定格式的视觉参考,如边界框和掩膜轮廓的空间坐标。包括张等人[52]和陈等人[5]在内的大多数方法,仅使用边界框作为视觉参考输入。虽然在结构化场景中效果显著,但在自然用户驱动的交互中,这种方法的适用性较差,因为视觉提示可能不符合标准几何形状。本文提出了一种简单却高效的解决方案:一个能够处理复杂视觉提示的大型多模态模型。
图1.ViP-LLaVA的核心设计理念。我们直接将多种视觉提示(如箭头、方框、圆圈、涂鸦等)叠加到原始图像上,随后将对应的视觉特征与文本嵌入输入大型多模态模型,以实现对话式辅助功能。本文通过红色箭头的示例进行说明。
图1.ViP-LLaVA的核心设计理念。我们直接将多种视觉提示(如箭头、方框、圆圈、涂鸦等)叠加到原始图像上,随后将对应的视觉特征与文本嵌入输入大型多模态模型,以实现对话式辅助功能。本文通过红色箭头的示例进行说明。

该模型能处理任意视觉提示,让用户通过直观标记图像并借助“红色边界框”或“带箭头指示点”等自然提示进行交互。我们的模型能识别这些视觉提示,为用户提供了将视觉参考融入语言对话的便捷方式。基于我们自身的观察和先前研究[38](该研究证明CLIP可理解视觉标记),我们直接将视觉提示注入原始图像空间,无需额外设计区域特定模型。尽管我们的方法看似简单,却带来了意想不到的突破:在需要精确区域感知和复杂推理的任务中,我们的模型创造了新的行业标杆。通过在Visual7W[57]和PointQA[29]的区域推理任务中展现的卓越表现,我们超越了现有采用区域编码技术的同类模型。

为深化该领域研究,我们推出ViP-Bench视觉提示基准测试,用于评估多模态模型在任意视觉提示下的区域理解能力。通过收集303张多样化图像及配套问题,我们从识别、OCR、知识、数学、对象关系推理和语言生成六个维度,对视觉理解能力进行全面评估。我们相信ViP-Bench将为未来研究任意视觉提示下的多模态模型奠定坚实基础。

主要贡献包括
•我们开发了新型多模态模型,通过自然语言和任意视觉提示实现图像直观交互,提升用户可操作性和模型灵活性。

•我们创新采用视觉提示叠加技术,直接将视觉提示叠加到图像上,简化模型架构而不影响性能。

•我们的ViP-LLaVA模型在权威基准测试中取得区域理解任务的顶尖成果,超越了专业区域编码模型。

•我们推出ViP-Bench视觉提示解释基准测试,为未来研究搭建了基础平台。

  1. Approach

我们的研究基于一个核心假设:大型多模态模型不仅要识别图像的视觉内容,更要能将任意视觉标记解读为用户交互的一部分。

在这里插入图片描述
图2.模型架构。在将视觉提示与原始图像进行alpha混合后,我们将生成的图像输入视觉编码器以获取多层级视觉特征。这些特征经过拼接后输入LayerNorm和MLP层,形成视觉标记。随后将视觉标记与文本指令标记输入大型语言模型,通过自回归方式生成语言响应。在指令微调过程中的冻结模块与可训练模块已被标注。

3.1.Visual Prompt Embedding via CLIP 通过CLIP进行视觉提示嵌入
与先前研究[34,52]构建新模块处理视觉提示的方法不同,我们充分利用CLIP[36]的现有能力对图像和叠加的视觉标记进行编码。具体而言,CLIP在视觉与文本数据对齐方面的专业能力使其成为理想选择——最新研究[38]表明,该模型能自然关注圆形、矩形等标记区域。实验结果进一步证明,CLIP可将注意力聚焦于箭头、随意涂鸦等多样化视觉提示。为利用这一特性,我们通过alpha混合技术(alpha blending)将视觉提示Pv叠加到原始图像Xv上,生成融合表示来突出关键区域:
在这里插入图片描述
其中α∈[0,1]表示视觉提示的透明度,Xv为原始图像,Pv为添加视觉提示后的图像。需要说明的是,**我们仅对视觉提示下方的像素进行透明度混合。合成图像Xˆv随后输入多模态模型。**为有效识别视觉提示,ViP-LLaVA在底层视觉特征与高层视觉特征之间实现了平衡。

为解决CLIP深层特征容易忽略低级细节的局限性[54],我们采用多层特征提取策略:选取第6层进行几何细节编码,同时利用第15、18、21、24层捕捉语义信息。将多层级特征拼接后,通过LayerNorm[2]进行标准化处理以确保训练稳定性,最终输入MLP层进行处理。该方案通过第5.4节的消融实验验证,能有效整合多元视觉线索。
我们采用直接叠加视觉提示的设计具有多重优势:既省去冗余处理模块降低模型复杂度,又契合用户使用多样化视觉标记的自然习惯。这种灵活机制使ViP-LLaVA能精准解析各类用户生成的视觉线索,显著提升其在实际场景中的应用价值。
为训练ViP-LLaVA模型,我们采用自回归语言建模技术,即通过最大化生成真实答案Xa的标记概率来实现:
在这里插入图片描述

其中θ表示可训练参数,Xinstruct为文本指令,L是答案Xa的序列长度,Xa,<i表示当前预测标记xi之前的所有答案标记,i代表文本标记生成的步骤。为简化表达,我们省略了系统消息项,尽管其属于条件输入。

该训练目标使模型能够通过理解视觉内容、语言指令和叠加提示,生成上下文准确的响应。这增强了模型的解读视觉标记(与图像同步)能力,从而提升其处理复杂、特定区域语言查询的水平。这种能力对于需要细致理解视觉元素和用户通过任意视觉提示传达意图的任务至关重要。

3.2. Visual Prompting Design
3.2.视觉提示设计

为训练模型识别和解析任意视觉提示,我们开发了一个全新的视觉提示指令调优数据集,因为此前缺乏可用于此类任务的视觉提示与指令输出文本配对数据集。

该数据集包含52万组标注有视觉提示的图文对,数据来源包括:
(1)单区域推理数据:来自RefCOCOg[49]的8万组指代理解与生成数据,以及PointQA-LookTwice[29]的3.7万组物体计数数据;
(2)双区域推理数据:Visual Genome[18]的8万组三元关系数据;
(3)多区域推理数据:Flicker 30k Entities[35]的3万组基于图像的描述数据,Visual Commonsense Reasoning数据集[51]的21.3万组数据,以及Visual7W[57]的8.2万组数据。

需要说明的是,所有数据均采集自来自上述数据集的训练集。

在这里插入图片描述

图3.视觉提示类型可视化。从左上到右下依次为:遮罩轮廓、椭圆、边界框、三角形、涂鸦、点、箭头和遮罩。值得注意的是,这些提示不仅形状各异,还具有丰富的颜色、透明度、宽度、比例和方向。

我们通过多种视觉提示自动标注每张图像。对于仅包含边界框标注的数据,我们从矩形、椭圆和箭头三种可能类别中随机选取视觉提示。特别注意确保箭头头部位于[(−W/₂,−H/₂),(W/₂,H/₂)]坐标范围内,其中W和H分别代表图像的宽度和高度。对于椭圆标注,其长轴和短轴长度直接取自边界框尺寸,并按[1,1.5]的比例进行放大。而对于带有真实像素级掩膜标注的区域,我们从以下八种可能性中随机选取视觉提示:矩形、椭圆、点、三角形、掩膜、掩膜轮廓、箭头以及使用贝塞尔曲线生成的涂鸦(见图3)。特别确保箭头头部、完整点、三角形和涂鸦均位于指定掩膜内。这些标注模拟了人类与图像的自然交互方式,用户常会使用自发标记来突出显示感兴趣区域。

对于涂鸦效果,我们采用贝塞尔曲线[8]模拟类人手绘。具体流程是:首先在对象蒙版内随机选取三个点作为二次贝塞尔曲线的锚点,随后将生成的贝塞尔曲线通过前文提到的Alpha混合技术合成到图像上,最终形成以涂鸦作为视觉引导的融合图像。

人类天生会运用各种视觉标记来突出环境中的物体。比如在教学场景中,老师常常用箭头或下划线引导学生关注图片或文字的特定部分。同样地,在日常交流中,人们会圈出照片中的重点内容,或是用涂鸦遮挡敏感信息再分享。通过我们的设计,我们打造了一个视觉指令跟随数据集,完美复刻人类与物体的视觉互动方式,让模型与用户的交互更加直观自然。

3.3. Optional Region-level Instruction Tuning Data
3.3.可选区域级指令调优数据

我们的训练数据来自两个来源:(i)第3.2节所述的区域级视觉提示数据,以及(ii)来自LLaVA-1.5[23]的无视觉提示图像级数据。这种策略使ViP-LLaVA能够进行类人对话,这主要得益于刘等人[24]提供的图像级LLaVA指令数据。此外,为提升ViP-LLaVA在区域级多模态对话中的表现,我们还借助GPT-4V开发了区域专属指令数据。

先前的研究方法如Shikra[5]尝试使用纯文本模型(如GPT4)生成区域级指令数据。然而,这种方法存在固有局限性,尤其在物体级任务中,由于缺乏视觉上下文,模型无法准确识别同一场景中多个同类物体。为解决这一问题,我们开发了一种基于GPT-4V的指令数据整理方法。与纯文本模型不同,GPT-4V能够解析图像中的视觉提示[46]。我们的方法包括将原始图像和经过标注视觉提示修改后的图像输入GPT-4V。同时,我们为模型提供原始数据集中的真实标注文本和系统提示信息。通过这一流程,我们为第3.2节所述数据集中的图像整理出<视觉提示、文本提示、文本输出><visual prompt,text prompt, text output>三元组。

我们引入了<红色遮罩>和<蓝色框内> and (,
)等特定文本表示法,帮助GPT-4V在单区域和多区域场景中识别视觉提示。在训练过程中,我们将这些文本替换为第3.2节描述的八个视觉提示集合,显著提升了数据集的通用性。我们共整理了13,000个高质量区域级指令数据点,包含7,000个单区域实例和6,000个多区域实例。补充材料中详细说明了系统消息(为模型提供生成回答的上下文约束或格式要求)、输入文本提示和生成文本输出的具体细节。

虽然ViP-LLaVA在标准视觉推理基准测试中即使没有这些丰富数据也能表现良好,但我们发现它有助于进一步提升模型在开放世界场景中进行类人对话的能力。

4. ViP-Bench for Evaluation用于评估的ViP-Bench

为系统评估多模态模型在视觉推理查询中的解释与响应能力,我们开发了ViP-Bench基准测试套件,专门用于评估模型在不同视觉提示下的区域理解能力。该测试包含303组独特图像-问题对,图像素材来自MM-Vet[50]、MMBench[25]和Visual Genome[18]数据库。每组图像对应多样化视觉推理问题,旨在检验模型的理解与解释能力。我们沿用了MM-Vet[50]和MMBench[25]中的问题模板(但进行了微调以适配区域-在视觉基因组项目中,我们自行设计问题和答案(包括特定视觉提示),并采用SAM模型[17]生成的边界框和掩码来标注物体位置。

ViP-Bench的设计核心在于其对区域级视觉理解六大关键维度的全面覆盖:图像识别、光学字符识别(OCR)、知识推理、数学运算、物体关系推理及语言生成。这种多维度的覆盖确保了模型在区域级视觉推理各方面的综合评估。

ViP-Bench采用与MM-Vet[50]相似的评分机制。我们使用最先进的语言模型GPT-4来评估多模态模型的响应。具体来说,我们将多模态模型的输出、人工标注的答案以及若干上下文评分示例输入GPT-4进行评分。GPT-4会根据0到10的评分标准对响应进行打分,从而量化评估多模态模型理解与解读视觉数据的能力。这套评分体系为不同模型的性能比较提供了标准化框架。

ViP-Bench经过人工精心标注,整个过程包含七轮验证流程,确保对象框/掩码、问题及答案的准确性和相关性。这种严格的标注流程保证了该基准测试作为模型评估工具的可靠性。表6中的示例展示了像GPT-4V这样的领先模型在ViP-Bench上对物体定位的误判,凸显了当前多模态理解面临的挑战。我们在补充材料中提供了ViP-Bench的更多可视化结果和统计分析。通过ViP-Bench,我们为科研界提供了一个宝贵的工具,助力多模态模型的开发与优化。我们相信,这个全面且富有挑战性的测试平台,将为视觉推理和多模态交互领域的未来发展奠定基础。

5.实验

本节将ViP-LLaVA与当前最先进的多模态模型进行对比,包括那些专门设计区域特定模块的模型,通过深入分析评估ViP-LLaVA的能力,并进行消融研究。

5.1. Training Setup

模型
视觉模型方面,我们选择CLIP-336px[36]来保留更多原始像素空间的信息。语言编码器采用Vicuna v1.5[43]。多模态连接器使用双层MLP网络。更多大模型基底的消融实验详见Supp.A.5。

训练与数据
初始训练阶段使用55.8万条BLIP[6,24]的图像-文本对预训练多模态连接器。
第二阶段结合LLaVA v1.5[23]指令数据与第3.2节区域级视觉提示数据集进行训练。
两个阶段均训练1个周期,7B/13B模型使用8块NVIDIA A100 GPU的总训练时间约为20/40小时。最终将1.3万条GPT-4V指令数据与第二阶段1.3万条采样数据混合生成2.6万条第三阶段训练数据,对第二阶段模型(称为ViP-LLaVA-Base)进行1个周期微调得到ViP-LLaVA模型,7B模型耗时约0.5小时,13B模型耗时1小时。

视觉提示
ViP-LLaVA使用8种视觉提示:矩形、椭圆、点、涂鸦、三角形、遮罩、遮罩轮廓和箭头。其属性(如颜色、粗细、alpha值[0.5-1])随机生成,箭头方向和长度随机化,但端点始终位于遮罩内。对于特定区域的引用,我们用颜色和形状描述来替换文本,例如红色涂鸦。训练过程中,系统会随机分配每个区域的视觉提示类型及其相关属性。

5.2. Evaluation on Region Reasoning Benchmarks 区域推理基准评估
。。。。

7. Conclusion

综上所述,ViP-LLaVA的研究表明,视觉提示在区域特定图像理解领域展现出巨大潜力。通过整合任意视觉提示,我们成功弥合了用户友好界面与区域理解所需精准度之间的鸿沟。ViP-LLaVA的直观设计巧妙结合自然语言交互与视觉标记,既简化了图像标注流程,又提升了视觉参考的清晰度。在Visual7W、PointQA和VCR等权威基准测试中,我们取得的顶尖表现充分验证了ViP-LLaVA的卓越效能。值得关注的是,ViP-Bench作为综合性评估平台的推出,为衡量多模态模型的区域推理能力树立了新标杆。ViP-LLaVA为后续研究奠定了坚实基础。我们相信,ViP-LLaVA能够启发视觉与语言模态的整合方式,从而实现更复杂、更细腻的人机交互。

Supplementary Material

这份补充材料通过补充因篇幅限制未在主论文中呈现的额外结果和深度分析,进一步拓展了我们的研究。
在A部分,我们对视觉提示生成、指令数据影响、箭头方向理解、不同视觉提示下的表现,以及各类大模型对传统视觉-语言模型基准测试的影响等主题进行了定性与定量分析,从而全面呈现了本研究的全貌。
B部分详细阐述了训练过程的具体细节。
C部分通过进一步的消融实验,深入解析了我们方法的设计思路与实际效果。
D部分重点讨论了区域描述等新增实验结果。
E部分展示了视觉提示增强技术的潜力探索。
F部分提供了来自ViP-Bench数据集的详细统计与可视化图表。

A. In-Depth Analysis 深度分析
A.1. Generalization to New Attributes 新属性的泛化

ViP-LLaVA模型经过八类视觉提示训练——包括掩膜轮廓、椭圆、边界框、三角形、涂鸦、点、箭头和掩膜——展现出显著的泛化能力。在主论文中,我们展示了该模型能理解人工绘制的视觉提示(如图7所示)。如主论文图8和图5所示,尽管未专门训练处理不同粗细和多样化的标记,ViP-LLaVA仍能熟练处理这些视觉提示。此外,该模型还能将文本标记有效转化为视觉提示,这一特性借鉴了Set-of-Mark[45]的启发。

图9、10和11展示了定性案例:图9中,ViP-LLaVA精准定位了标注为“1”、“2”和“3”的物体,并为每个物体生成精确描述;图10展示了模型识别数字标记并准确描述车辆颜色的能力,尽管标记颜色与实际车辆颜色存在反事实差异;图11则展示了模型在密集标记场景中定位柠檬的能力。

A.2. Effect of Optional GPT-4V Region-Level Instruction Data可选GPT-4V区域级指令数据的影响

如主论文第3.3节所述,将GPT-4V作为指令数据的补充来源,可显著提升ViP-LLaVA的性能。图12展示了数据整合流程的示例。为此,我们将原始第二阶段指令数据集的13,000条数据与等量的GPT-4V区域级数据进行整合。通过整合指令数据条目,我们构建了一个包含26,000条指令的第三阶段微调数据集。在8块NVIDIA A100 GPU上,我们对第二阶段模型进行单轮微调,7B模型耗时约0.5小时,13B模型则需1小时。如表8所示,经过微调的ViP-LLaVA模型在几乎所有数据集上都展现出显著提升,充分验证了GPT-4V指令数据的优化流程。值得注意的是,即使不使用GPT-4V指令数据,ViP-LLaVA在Visual7W、PointQALookTwice和ViP-Bench等基准测试中仍优于现有方法。而引入GPT-4V指令数据后,其性能优势更是得到了进一步强化。

在这里插入图片描述图12.区域级指令数据的整理流程。该图展示了原始图像、标注图像及其对应文本提示整合到GPT-4V模型中的工作流程,从而生成针对特定区域任务的详细指令数据。

A.3. Understanding Arrow Direction 理解箭头方向

为严格评估ViP-LLaVA对箭头方向的解析能力,我们基于COCO验证集[22]构建了具有挑战性的示例数据集。具体而言,我们生成了多个包含箭头的场景:箭头从一个物体的边界框中心出发指向另一个物体的中心,反之亦然。这些可视化效果如图13所示。典型的提示语句如下:判断物体A(类别1)或者物体B(类别2)是否位于箭头的头部,另一个物体则代表尾部。需要特别说明的是,我们确保每对物体都属于不同的类别。共收集并分析了3520个这样的配对样本。令人印象深刻的是,ViP-LLaVA-13B模型达到了90.28%的准确率,这不仅展现了对箭头方向性的深刻理解,还排除了其他可能的干扰因素。

A.4. Performance across Different Visual Prompts不同视觉提示下的表现

在训练过程中,我们采用了八种视觉提示类型。本研究重点考察各类视觉提示在下游任务中的表现。需要说明的是,在指令微调阶段,我们对区域级训练数据进行了八次重复训练。

表9展示的VCR、Visual7W、PointQA和ViP-Bench测试结果表明,我们的7B模型在不同视觉提示下均保持稳定准确,其中“点状”和“椭圆”提示的性能表现略优于其他类型。

A.5. Impact of Different LLMs on Image-level and Region-level Benchmarks不同语言模型对图像级与区域级基准测试的影响

本研究重点探讨大型语言模型骨干网络对视觉语言基准测试的影响,涵盖图像整体与局部区域两个维度。具体实验采用Vicuna-1.5-7B、Vicuna-1.5-13B[43]、Llama-3-8B[30]和Phi-3-mini等模型作为LLaVA-1.5[23]和ViP-LLaVA的通用语言模型框架,同时保持其他配置和超参数不变。这两种语言模型的结果分别展示在表10和表11中,对应的雷达图则见图14(a)和(b)。

基准缩写源于空间限制。
完整的图像级基准测试来自官方LLaVA-1.5数据集,包括:视觉问答(MMB):MMBench[25];中文视觉问答(MMBCN):MMBench-Chinese[25];野生场景视觉问答(LLaVAW):LLaVABench[24];POPE[21];科学问答(SQAI):ScienceQAIMG[28];医学问答(MM-Vet)[50];视觉问答[14];MME[10];VQAT:文本问答(VisWiz[14];MME[10];VQAT:TextVQA)[39];视觉问答(VQA-v 2[13];GQA[16];SEEDI:)SEED-Bench-1[19]图像子集。

区域级基准测试包括:视觉问答(V7W):Visual7W[57];点对点问答(PointQA):PointQALookTwice[29];视觉问答(ViP-BBbox):ViP-Bench带紧框条件;视觉问答(ViP-BHuman):ViP-Bench带人工标注视觉提示。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值