||MLLM Series Tutorial @ ACM MM 2024||第五部分:MLLM Hallucination(MLLM的幻觉现象)

目录

0 完整Tutorial内容

1 What’s Hallucination in MLLMs (什么是MLLMs中的幻觉)

1.1 什么是MLLM中的幻觉?

1.2 MLLM中的幻觉类型

2 Causes of Hallucinations in MLLMs (幻觉的原因)

2.1 Noisy Data (噪声数据)

2.2 Lack of Data Diversity (数据多样性不足)

2.3 Hallucinations from Vision Model (来自视觉模型的幻觉)

2.4 Hallucinations from Language Model (来自语言模型的幻觉)

3 Multimodal Hallucination Metrics and Benchmarks (多模态幻觉的评估标准和基准)

3.1 评估幻觉的两大类方法

3.2 评估任务

3.3 评估标准

3.4 基准数据集问题

3.5 基于人类专家的评估基准

3.6 具体示例

4 Multimodal Hallucination Mitigation (多模态幻觉的缓解方法)

4.1 Introduce Negative Data (引入负面数据)

4.2 Address Noises and Errors (解决噪声和错误)

4.3 Training-related Mitigation-RLHF (训练相关的缓解方法-RLHF)

4.4 Post-hoc Correction (事后修正)

5 解决MLLM幻觉未来的方向


0 完整Tutorial内容

本文为"⭐⭐MLLM Tutorial⭐⭐——多模态大语言模型最新教程"——第五部分的学习笔记,完整内容参见:

⭐⭐MLLM Tutorial⭐⭐——多模态大语言模型最新教程-CSDN博客

1 What’s Hallucination in MLLMs (什么是MLLMs中的幻觉)

1.1 什么是MLLM中的幻觉?

在多模态大型语言模型(MLLMs)中,幻觉指的是模型生成的输出与实际内容不一致的现象。例如,当模型生成的答案与视觉输入相矛盾时,便会出现幻觉。例如,给定一张显示男孩正在打网球的图片,问题是关于在地面上靠近黄色网球的地方定位水瓶。尽管图像中没有水瓶,像GPT-4等模型(V1,V2,LA 1.0)仍然可能生成幻觉答案,声称图像中有水瓶。 

1.2 MLLM中的幻觉类型

一般来说,MLLM中的幻觉可以分为三种类型:

  1. 物体幻觉:指生成了不存在的物体或错误的类别。例如,模型可能描述图像中的物体为一束花,但图像中并没有这样的花,从而产生了物体幻觉。
  2. 属性幻觉:涉及对颜色、形状、材质、内容甚至计数的错误描述。例如,模型可能会说花是粉色的,但实际花的颜色并不是粉色,这就会产生属性幻觉。
  3. 关系幻觉:指错误的人物与物体之间的互动或相对位置。例如,模型可能会说图像中的人们站在女孩周围,但实际上并非如此,这会导致关系幻觉。

Causes of Hallucinations in MLLMs (幻觉的原因)

2.1 Noisy Data (噪声数据)

训练数据中可能包含不准确或错误的信息,这些数据被用来训练多模态语言模型时,可能导致幻觉。例如,某些从网上收集的图像-文本配对数据可能包含错误的信息。举个例子,在预训练阶段,数据中可能会描述“图像中有8个人在等待修剪”,但实际上图像中并没有这些人。这种噪声数据会导致模型生成错误的答案,进而产生幻觉。

2.2 Lack of Data Diversity (数据多样性不足)

训练数据集可能缺乏足够的多样性,特别是在指令跟随任务中,许多数据集只包含正面指令,而缺乏负面指令。例如,模型可能只被训练来回答“是”或者“不是”类型的问题,但在实际应用中,模型需要能够处理更多样化的指令。如果数据集只包含正面指令,模型可能会偏向于输出“是”的回答,而忽略拒绝或者否定的可能性,从而影响模型的生成质量。

2.3 Hallucinations from Vision Model (来自视觉模型的幻觉)

视觉模型的能力不足可能导致幻觉的产生。视觉编码器如果不够强大,可能无法准确理解图像内容,导致生成错误的答案。例如,当问题询问图像中的费用总和时,视觉模型可能无法清晰地从图像中提取出正确的数字,因此给出错误的答案。举个例子,当模型需要从图像中读取数据时,如果视觉模型无法清楚地看到图像中的内容,它可能会误解图像并给出错误的答案。

2.4 Hallucinations from Language Model (来自语言模型的幻觉)

语言模型的能力通常比视觉模型强大,因此模型可能更多依赖于语言模型的记忆而不是图像信息,从而产生幻觉。例如,当问题要求基于图表提供信息时,模型可能会根据先前的记忆生成答案,而不是基于当前图像的内容。举个例子,在2008年北京奥运会金牌数的问题中,即使图像中的信息已经修改,模型仍然基于其语言模型的记忆错误地回答“中国金牌最多”,而没有正确分析图像中的新数据。 

Multimodal Hallucination Metrics and Benchmarks (多模态幻觉的评估标准和基准)

3.1 评估幻觉的两大类方法

幻觉的评估可以分为两大类:

基于语言模型(LLM)的评估:这类方法侧重于生成式任务,模型需要根据开放性问题给出答案。

基于非语言模型的评估:这类方法侧重于判别式任务,模型只需回答“是”或“不是”这样简短的回答。

3.2 评估任务

幻觉评估任务也分为两类:

生成任务(Generative Task):这是一个开放性问题,模型可以生成答案而不仅仅是“是”或“不是”。

判别任务(Discriminative Task):这是一个分类任务,模型需要通过“是”或“不是”来回答问题,判定图像中是否存在某物。例如,问题可能是:“图像中是否有水瓶?”模型根据问题回答“是”或“不是”。

3.3 评估标准

相关性分数(Relevance Score):这个标准用于评估模型生成的答案是否与问题相关,是否回答了问题。

准确性(Accuracy Score):该标准用于评估模型生成的答案是否与图像内容一致,即模型是否准确地理解了图像内容。

3.4 基准数据集问题

当前多模态大型语言模型的评估基准大多来源于如MSCOCO等数据集。然而,这些数据集在训练过程中有时没有包括图像信息,这可能导致评估不公平。具体来说,有些模型在训练时可能包含了更多的图像数据,而其他模型则没有,这使得它们的对比不公平。

3.5 基于人类专家的评估基准

为了更加公平和全面地评估多模态语言模型的幻觉,建议构建由人类专家设计的基准。这些基准包含更多样化的图像标签,涵盖海报、图表、视频、地图等内容。每个图像配有多个问题,且每个问题只会在一个或两个词上有所变化。如果模型能够正确回答所有问题,则视为模型成功预测。

3.6 具体示例

判别任务的例子:比如,“图像中是否有水瓶?”这是一个基于“是”或“不是”的问题,模型需要通过判断图像中的内容来做出回答。

生成任务的例子:比如,“你能帮我找到带有字母B的狗吗?”这是一个开放性问题,模型需要生成完整的答案,而不仅仅是回答“是”或“不是”。

4 Multimodal Hallucination Mitigation (多模态幻觉的缓解方法)

4.1 Introduce Negative Data (引入负面数据)

该方法通过在训练数据中加入负面样本来增加模型的鲁棒性。负面数据包括与正面数据相对的示例,例如“非存在物体操作”或“错误操作”。这样可以帮助模型更好地理解何时不能执行某个任务。例如,在任务中,如果问题涉及对象检测(例如“图像中是否有某个物体”),正面样本可能包含正常的物体识别任务,而负面样本则可以包含无物体或错误的操作任务。通过这种方式,模型在处理幻觉问题时能够避免生成不符合事实的答案。

4.2 Address Noises and Errors (解决噪声和错误)

该方法关注如何通过减少训练数据中的噪声和错误来减轻幻觉问题。例如,使用生成式模型(如GPT-4)来生成更准确的图像描述,从而减少噪声。例如,MS COCO数据集中,人工生成的简短图像描述常常缺乏足够的信息,可能导致模型产生错误的推理。通过使用更精确的图像描述和与视觉内容更为一致的训练数据,可以减少模型的幻觉。作者提到通过精心设计的生成任务(如GPT-4生成的高质量图像描述),模型能够生成更准确的答案,从而降低幻觉的风险。

4.3 Training-related Mitigation-RLHF (训练相关的缓解方法-RLHF)

强化学习与人类反馈(RLHF)是一种训练方法,可以通过不断优化模型的偏好来减少幻觉。在此方法中,模型的输出会根据人类反馈进行调整,从而逐步改进模型的表现。例如,模型可以根据人类的反馈优化回答的准确性和相关性,通过这种训练策略,模型会逐渐学会避免错误的推理和幻觉生成,提供更精确的答案。

4.4 Post-hoc Correction (事后修正)

该方法在模型生成答案之后进行后处理,修正模型的错误或不准确的部分。具体来说,当模型生成答案后,可以根据一些关键字和概念来检查答案的准确性。然后,模型可以重新评估这些生成的答案,检测其中的幻觉部分并进行修正。例如,如果模型生成的答案包含错误信息(如提到图像中有某个人,但图像实际上没有人),通过后处理,模型可以识别并纠正这些错误。通过这种方式,模型的答案会更加准确。
例如,作者提到在一个具体的例子中,模型最初的答案提到图像中有一个人,而后通过后处理,模型识别到图像中并没有人,最终修正了答案。

5 解决MLLM幻觉未来的方向

  • 建立更标准的基准测试:目前的评估方法多局限于“是”或“否”的简单判断,模型的回答可能无法准确反映实际情况。作者提出,未来应建立更标准化、易于使用的基准测试,能够支持更自由的问答,避免过于简单的“是/否”回答,这样能提高模型的准确性。

  • 发展低成本的评估模型:现有的评估方法如GPT-4等通常需要支付费用,作者建议如何开发更便宜、有效的评估模型,从而降低成本。

  • 将幻觉视为一种特性:作者指出,幻觉可能不仅仅是错误的答案,也可以被视为模型的“想象力”。如果能够更好地控制模型生成的“幻觉”,也许能够发挥其创造性,使得模型能够更精准地结合图像信息并生成更富有创意的回答。例如,幻觉的部分可以被视为模型对于数据的想象,这样可以帮助模型更好地进行创新,生成更具创意的内容。

已经博主授权,源码转载自 https://pan.quark.cn/s/fdfcb1303993 ### 高速电路接口原理与应用详解 #### 引言 信息技术的迅猛进步推动了高速数据传输需求的持续提升,特别是在高性能计算、网络通信等关键领域。为了达成高效的数据交换,高速集成电路间的互连技术成为了研究的热点。本文将系统阐述几种典型的高速接口规范——PECL(Positive Emitter Coupled Logic)、LVECL(Low Voltage Emitter Coupled Logic)、CML(Current Mode Logic)和LVDS(Low Voltage Differential Signaling),并深入分析它们的电路构造和应用特性。 #### 1. ECL电路基础 ECL电路是早期为应对高速数据传输需求而研发的一种逻辑电路,其运行速度极快,最高可达到10Gbps。通过维持晶体管工作于线性和截止区域,ECL电路有效规避了饱和区的影响,从而获得了迅速的开关响应。接下来将具体解析ECL电路的构成要素及其运作机制。 #### 1.1 ECL线接收器电路组成 - **差分放大器**:由晶体管Q3、Q4、Q5构成,是整个电路的核心部分。其中,Q5作为恒流源,具备较大的交流等效电阻,能够提供稳定的电流,确保电路的稳定运作。 - **发射极跟随器输出电路**:由Q1、Q2组成,主要用于电平调整和输出驱动,确保输出信号与下一级电路的兼容性。 - **偏置电源**:由Q6、Q7以及二极管D1、D2构成,为差分放大器提供可靠的偏置电压,使其始终工作在线性放大区间。 #### 1.2 ECL电路的显著特性 - **高运行速率**:由于晶体管工作在线性和截止状态,不受...
源码直接下载地址: https://pan.quark.cn/s/27dcad4290ca Silicon Labs(前身为Silicon Laboratories)为其USB至UART转换控制器开发了一款官方驱动程序,即CP210x驱动,该驱动程序在Windows 10操作系统上表现出色。此驱动确保计算机能够识别并有效通信与使用配备CP210x芯片的设备,包括开发板、模块或USB转串口适配器。CP2012作为CP210x系列中的一个型号,同样受益于该驱动程序的支持。驱动程序版本v6.7.3代表一个较新的升级,其目标在于解决兼容性挑战,增强性能并提升稳定性。"win10"标签突出了该驱动对Windows 10系统的优化及兼容性,暗示用户在Windows 10环境下可以无障碍地运用CP210x设备。压缩包内含的文件如下: 1. `slabvcp.cat`:作为验证文件,用于核实驱动程序的数字签名,确保驱动源自可信渠道且未被篡改。 2. `CP210xVCPInstaller_x64.exe` 和 `CP210xVCPInstaller_x86.exe`:这两个安装程序分别针对64位和32位的Windows系统设计,用户需依据自身操作系统选择适配版本进行安装。 3. `slabvcp.inf`:作为驱动配置文档,其中包含驱动程序的安装参数,Windows系统将依据此文件进行驱动安装与配置。 4. `SLAB_License_Agreement_VCP_Windows.txt`:作为许可文件,用户在安装前须仔细阅读并确认同意其中的条款。 5. `dpinst.xml`:该部署脚本旨在简化驱动安装流程,自动化安装过程以确保驱动正确部署至系统。 6. `x86` 和 `x64...
内容概要:本文针对高渗透率电动汽车随机充电行为对配电网承载能力的影响,开展脆弱性分析与广义需求响应协同优化研究。通过构建包含电动汽车、分布式光伏、静止无功补偿器等多类型设备的配电网系统模型,建立涵盖一次设备安全、负荷平稳性、电能质量和系统效率的多维评价指标体系,并采用熵权法与模糊综合评价相结合的双层模型对配电网承载能力进行量化评估。研究通过Matlab仿真分析不同电动汽车渗透率下的系统指标变化规律与灵敏度,揭示其对电网的冲击特性,并提出基于广义需求响应的优化调控策略以提升系统承载能力与运行韧性。; 适合人群:具备电力系统、智能电网或相关领域基础知识,从事新能源接入、配电系统规划与优化研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①评估高比例电动汽车接入背景下配电网的承载极限与脆弱性;②分析随机充电行为对电网安全性、稳定性与电能质量的影响;③设计并验证基于需求响应的协同优化策略以缓解电网压力、提升系统灵活性与适应性。; 阅读建议:本文配套Matlab代码实现,建议读者结合文中模型框架与仿真案例进行复现与拓展,重点关注多维指标构建、熵权法权重计算与模糊综合评价的实现过程,并可通过调整渗透率、负荷特性等参数深化对系统脆弱性演化规律的理解。
内容概要:Word文档批量工具是一款面向Windows平台的本地化文档批量处理软件,基于python-docx构建,提供17项核心批量能力,包括批量查找替换文本、批量拆分合并文档、批量转换导出PDF/TXT/HTML/Markdown/PNG、批量替换联系方式(手机号、邮箱、链接、QQ、)、批量为文档加密、批量处理页眉页脚、批量生成邮件合并、批量添加超链接、批量清理修复文档、批量套用样式排版、批量操作表格与图片、批量生成目录、批量插入文本、批量添加水印以及批量清除隐私属性。软件支持一次导入成百上千份Word文档,逐份生成独立结果并保留源文件,操作简单高效。 适用人群:适用于需要频繁处理大量Word文档的职业人士,包括行政人员、教师、编辑、企业数据处理人员、文员、法律工作者、市场运营人员等。凡是需要统一修改文档措辞、转换格式、拆分合并、保护敏感信息或生成个性化信函的个人或团队,均可从本工具中受益。 使用场景及目标:典型场景包括:行政人员批量统一百余份通知的落款与文号,只需拖入文件夹并设定替换规则,即可快速生成全部修订稿;教师批量给试卷添加水印并导出PDF,通过水印与格式转换功能一次完成套印与发布;企业数据处理者利用邮件合并功能,将模板与数据表合并生成整套个性化信函,省去逐份手工填写。本软件旨在将数小时的重复劳动压缩为一次点击,显著提升文档处理效率,并确保处理结果与原文档结构保持一致。 其他说明:本软件为Windows桌面应用,兼容Windows 10及以上系统,支持.docx和.doc格式,可正确处理包含多节、页眉、页脚、脚注的复杂文档。安装方式为运行安装包(word-batch-tool.exe)即可,全程本地处理,文档内容不经过任何网络传输,无需联网,有效保障数据隐私安全。软件保留源文件,输出独立结果,操作门槛低,适合非技术用户轻松上手。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值