摘要
使用机器生成的指令跟踪数据进行指令调优大型语言模型 (LLM) 已被证明可以提高新任务的零样本能力,但这一想法在多模态领域的探索较少。我们首次尝试使用纯语言 GPT-4 来生成多模态语言图像指令跟踪数据。通过对此类生成数据进行指令调整,我们推出了 LLaVA:大型语言和视觉助手,这是一种端到端训练的大型多模态模型,连接视觉编码器和 LLM 以实现通用视觉和语言理解。为了促进未来视觉指令跟随的研究,我们构建了两个具有多样化且具有挑战性的面向应用的任务的评估基准。我们的实验表明,LLaVA 表现出令人印象深刻的多模态聊天能力,有时在未见过的图像/指令上表现出多模态 GPT-4 的行为,并且与合成多模态指令跟踪数据集上的 GPT-4 相比,产生了 85.1% 的相对分数。在 Science QA 上进行微调后,LLaVA 和 GPT-4 的协同作用达到了 92.53% 的最新准确率。我们公开 GPT-4 生成的视觉指令调整数据、我们的模型和代码。
1 引言
人类通过视觉、语言等多种渠道与世界互动,每种渠道在表达和交流某些概念方面都有独特的优势,从而有助于更好地理解世界。人工智能的核心愿望之一是开发一种通用助手,能够有效地遵循多模式视觉和语言指令,与人类意图相一致,以在野外完成各种现实世界任务[4,27,26 ]。
为此,社区对开发语言增强的基础视觉模型产生了浓厚的兴趣 [27, 16],在开放世界视觉理解方面具有强大的能力,例如分类 [40, 21, 57, 54, 39]、检测[29,62,33],分割[25,63,58]和字幕[50,28],以及视觉生成和编辑[42,43,56,15,44,30]。我们建议读者参阅《Computer Vision in the Wild》阅读列表,以获取更新的文献汇编 [12]。在这一工作中,每项任务都由一个大型视觉模型独立解决,模型设计中隐含地考虑了任务指令。另外,语言仅用于描述图像内容。虽然这使得语言在将视觉信号映射到语言语义(人类交流的常见渠道)方面发挥着重要作用,但它导致模型通常具有固定的界面,交互性和对用户指令的适应性有限。
另一方面,大型语言模型(LLM)已经表明语言可以发挥更广泛的作用:通用助手的通用接口,其中各种任务指令可以用语言明确表示并指导端到端训练有素的神经助手切换到感兴趣的任务来解决它。例如,ChatGPT [35] 和 GPT-4 [36] 最近的成功证明了一致的LLM在遵循人类指令方面的力量,并激发了人们对开发开源LLM的巨大兴趣。其中,LLaMA[49]是一个开源的LLM,与GPT-3的性能相匹配。 Alpaca [48]、Vicuna [9]、GPT-4-LLM [38] 利用各种机器生成的高质量指令跟踪样本来提高 LLM 的对齐能力,与专有的 LLM 相比,报告了令人印象深刻的性能。重要的是,这一行的工作仅限于文本。
在本文中,我们提出了视觉指令调整,这是将指令调整扩展到语言图像多

1320




被折叠的 条评论
为什么被折叠?



