Visual Instruction Tuning----视觉指令调整

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

摘要

使用机器生成的指令跟踪数据进行指令调优大型语言模型 (LLM) 已被证明可以提高新任务的零样本能力,但这一想法在多模态领域的探索较少。我们首次尝试使用纯语言 GPT-4 来生成多模态语言图像指令跟踪数据。通过对此类生成数据进行指令调整,我们推出了 LLaVA:大型语言和视觉助手,这是一种端到端训练的大型多模态模型,连接视觉编码器和 LLM 以实现通用视觉和语言理解。为了促进未来视觉指令跟随的研究,我们构建了两个具有多样化且具有挑战性的面向应用的任务的评估基准。我们的实验表明,LLaVA 表现出令人印象深刻的多模态聊天能力,有时在未见过的图像/指令上表现出多模态 GPT-4 的行为,并且与合成多模态指令跟踪数据集上的 GPT-4 相比,产生了 85.1% 的相对分数。在 Science QA 上进行微调后,LLaVA 和 GPT-4 的协同作用达到了 92.53% 的最新准确率。我们公开 GPT-4 生成的视觉指令调整数据、我们的模型和代码。

1 引言

人类通过视觉、语言等多种渠道与世界互动,每种渠道在表达和交流某些概念方面都有独特的优势,从而有助于更好地理解世界。人工智能的核心愿望之一是开发一种通用助手,能够有效地遵循多模式视觉和语言指令,与人类意图相一致,以在野外完成各种现实世界任务[4,27,26 ]。

为此,社区对开发语言增强的基础视觉模型产生了浓厚的兴趣 [27, 16],在开放世界视觉理解方面具有强大的能力,例如分类 [40, 21, 57, 54, 39]、检测[29,62,33],分割[25,63,58]和字幕[50,28],以及视觉生成和编辑[42,43,56,15,44,30]。我们建议读者参阅《Computer Vision in the Wild》阅读列表,以获取更新的文献汇编 [12]。在这一工作中,每项任务都由一个大型视觉模型独立解决,模型设计中隐含地考虑了任务指令。另外,语言仅用于描述图像内容。虽然这使得语言在将视觉信号映射到语言语义(人类交流的常见渠道)方面发挥着重要作用,但它导致模型通常具有固定的界面,交互性和对用户指令的适应性有限。

另一方面,大型语言模型(LLM)已经表明语言可以发挥更广泛的作用:通用助手的通用接口,其中各种任务指令可以用语言明确表示并指导端到端训练有素的神经助手切换到感兴趣的任务来解决它。例如,ChatGPT [35] 和 GPT-4 [36] 最近的成功证明了一致的LLM在遵循人类指令方面的力量,并激发了人们对开发开源LLM的巨大兴趣。其中,LLaMA[49]是一个开源的LLM,与GPT-3的性能相匹配。 Alpaca [48]、Vicuna [9]、GPT-4-LLM [38] 利用各种机器生成的高质量指令跟踪样本来提高 LLM 的对齐能力,与专有的 LLM 相比,报告了令人印象深刻的性能。重要的是,这一行的工作仅限于文本。

在本文中,我们提出了视觉指令调整,这是将指令调整扩展到语言图像多

【AI论文】Visual Instruction Tuning 作者的目标是通过多模态指令微调(Visual Instruction Tuning)来训练一个通用的视觉助手,使其能够理解用户的语言指令并与视觉内容结合完成任务。例如,用户可以上传图片并提出问题,模型根据图片内容作出回答。现有的多模态指令执行模型大致可以分为以下两类:端到端训练的模型基于系统协调多个模型核心: 将图像的描述和边框输入给GPT,让GPT生成指令(对话、详细描述、推理性)。多模态数据的现状:解决方案:利用现有的图片-文本对: 问题: 此类简单扩展数据虽然成本低,但缺乏多样性和深度推理。 阅读详情

相关推荐

Visual Instruction Tuning》(LLava)文章翻译-细读理解

LLava全文阅读,实时更新

qq_62111160的博客 1320

多模态大模型综述: LLaVA, MiniGPT4

题目: Visual Instruction Tuning机构:微软论文:任务: 视觉指令微调(具备对话,推理的能力,rather than 图像描述)特点: 利用GPT4做数据生成,以及评测,视觉projection不想BLIP2一样是Q-Former,而是一个简单的映射层方法: LLM选择LLaMA,然后做视觉指令微调前置相关工作:GPT4, LLaMA, BLIP2, OpenFlamingo同期相似性工作:InstructBLIP。

pku_langzi的博客 6972

Llava论文阅读:Visual Instruction Tuning

以前的研究显示,通过使用机器生成的指令遵循数据来训练LLMs,可以提升模型在新的任务上的零样本学习能力。但在多模态领域,这个想法还没有被充分探索。研究人员首次尝试使用仅处理语言的GPT-4模型来生成多模态的语言图像指令遵循数据。同时引入了一个名为LLaVA的新模型在生成的数据上进行指令微调。这个模型是一个端到端训练的大型多模态模型,它将视觉编码器(用于理解图像)和大型语言模型(LLM)连接起来,用于 通用的视觉和语言理解。为了促进未来在视觉指令遵循方面的研究,研究人员构建了两个评估基准。

weixin_46231495的博客 2170

LLaVA:visual instruction tuning

主要目标是有效利用预训练的llm和视觉模型的能力,llama作为llm,预训练的clip视觉编码器ViT-L/14,提供Zv,用一个简单的线性层来将图像特征连接到单词embedding空间,用一个可训练的投影矩阵w将Zv转换为语言embedding标记Hq,其维度与语言模型中的单词embedding空间相同。对应于LLaVA的两个训练阶段,LLaVA的训练数据也分为两部分:预训练阶段的数据和微调阶段的数据。llava当时的GPT4还不支持图像输入,因此这样的测评也不完全能够展示GPT4的能力。

liguandong 3274

Visual Instruction Tuning: 用LLaVA近似多模态GPT-4

©Paperweekly 原创 · 作者 |Chunyuan Li使用 GPT-4 进行视觉指令学习!Visual Instruction Tuning with GPT-4!▲Generated by GLIGEN (https://gligen.github.io/): A cute lava llama and glasses我们分享了 LLaVA (Language-and-Visio...

Paper weekly 3073

【多模态】28、LLaVA 第一版 | Visual Instruction Tuning 多模态模型的指令微调

本文主要介绍 LLaVA 第一版模型

呆呆的猫的博客 6118

Visual Instruction Tuning 开源项目教程

Visual Instruction Tuning 开源项目教程 项目介绍 Visual Instruction Tuning 是一个开源项目,旨在通过使用机器生成的指令跟随数据来调整大型语言模型(LLMs),以提高其在多模态领域的零样本能力。该项目首次尝试使用仅语言的 GPT-4 生成多模态语言-图像指令跟随数据,并通过在此类生成的数据上进行指令调整,引入了 LLaVA(Large Langua...

gitblog_00777的博客 402

【论文笔记】Visual Instruction Tuning

使用机器生成的指令遵循数据对大型语言模型(LLMs)进行指令微调已被证明可以提升新任务上的零样本能力,但在多模态领域这一想法探索较少。我们首次尝试使用仅语言GPT-4生成多模态语言-图像指令遵循数据。通过对这些生成数据进行指令微调,我们引入了LLaVA:大型语言和视觉助手,这是一个端到端训练的大规模多模态模型,它将视觉编码器和LLM连接起来,以实现通用视觉和语言理解。为了促进未来对视觉指令遵循的研究,我们构建了两个具有多样性和挑战性应用任务的评估基准。

小嗷犬的博客 2064

Visual Instruction Tuning——视觉指令调优

Visual Instruction Tuning——视觉指令调优

Together_CZ的博客 1403

读论文笔记-LLaVA:Visual Instruction Tuning

研究机构:Microsoft Research发表于2023的NeurIPS。

qq_73697176的博客 1341

《Llava:Visual Instruction Tuning》论文精读笔记

《Llava:Visual Instruction Tuning》论文精读笔记

小小老大MUTA的博客 1175

Visual Instruction Tuning 教程

Visual Instruction Tuning 教程 本教程旨在指导您如何高效地探索和应用Visual Instruction Tuning项目,这是一个结合了大型语言模型与视觉理解的先进项目。我们将一步步带您了解其核心组件,并提供清晰的操作指南。 1. 项目目录结构及介绍 以下是Visual Instruction Tuning项目的基本目录结构概览,以及各部分的主要功能说明: Visual...

gitblog_00701的博客 468

视觉指令微调(Visual Instruction Tuning, VIT)

视觉指令微调(VIT)是多模态AI的核心技术,通过自然语言指令引导视觉模型完成多样化任务。该技术将视觉模型与语言模型联合训练,实现任务泛化、交互灵活和数据高效三大目标。关键技术包括多模态指令数据构建、指令感知特征交互和轻量化微调策略。典型应用涵盖通用视觉助手、工业分析和零样本场景。当前面临幻觉问题和任务平衡等挑战,但LLaVA、InstructBLIP等模型已取得显著进展。未来将向动态指令理解、具身智能融合等方向发展,有望成为实现通用AI的重要基石。

qq_40165706的博客 798

LLaVA论文(Visual Instruction Tuning)阅读笔记

背景:使用机器生成的指令跟随数据(machine-generated instruction-following data)对大语言模型(LLM)进行指令调整可以增强它的零样本能力。本文旨在将这种思想扩展到多模态领域。本文的贡献:展示了第一个基于生成多模态指令跟随数据集。模型。LLaVA模型通过连接视觉编码器和语言模型,实现了通用的视觉和语言理解能力。LLaVA具有不错的多模态对话能力,在未见过的图像和指令上有时达到多模态GPT-4的水准(85.1%的相对得分)。

qq_58400270的博客 7706

Improved Baselines with Visual Instruction Tuning——通过视觉指令调优改进基线

Improved Baselines with Visual Instruction Tuning——通过视觉指令调优改进基线

Together_CZ的博客 2542

【论文阅读】Visual Instruction Tuning

论文题目:研究领域:作者单位:论文来源:NIPS2023本文在多模态指令跟随领域做出了重要的贡献,通过引入视觉指令调优的概念和技术,成功地开发出LLaVA这一端到端的多模态助手模型。LLaVA不仅展示了在视觉和语言理解任务中的强大能力,还通过生成高质量的指令数据,为模型训练打下了坚实的基础。建立的LLaVA-Bench评估基准进一步推动了模型性能的系统性评估,为未来的研究提供了有力支持。我们期待这些创新能够激发更多研究者的兴趣,拓展多模态模型的应用和发展,最终实现更为智能和人性化的互动系统。

菜菜史迪仔的博客 1352

NIPS2024论文《Visual instruction tuning》LLaVA视觉大模型技术介绍

现在的大型语言模型(LLM)在语言对话与问答等任务中表现出优秀的性能。但是,对于多模态的输入(例如一张图片以及一个关于这张图片的问题),大型语言模型就难以应对,尤其是考察其推理能力时。

qq_37261357的博客 2900

Paper 0 | Visual Instruction Tuning

【解决WHY 2】

weixin_53116058的博客 931
上一篇: BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Mode
下一篇: MINIGPT-4: ENHANCING VISION-LANGUAGE UNDERSTANDING WITH ADVANCED LARGE MINIGPT-4:利用先进的大型语言模型增强视觉语言理解
Mars_prime
博客等级 码龄6年 764粉丝 · 80原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值