论文阅读 CVPR 2026 Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak

总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894

Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks

https://openaccess.thecvf.com/content/CVPR2026/papers/Cong_Anchoring_the_Mind_of_Multimodal_Reasoners_Cognitive_Bias_as_a_CVPR_2026_paper.pdf
在这里插入图片描述

CVPR | LLM锚定效应越狱攻击

📄 论文信息
该论文题为《Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks》,作者Linhua Cong、Bingrui Sima和Kun He来自华中科技大学。该论文研究模型的认知安全:模型识别出危险意图后,仍可能用“教育用途”等理由将其合理化。

🚨 发现痛点
以往研究常从图像扰动、文字隐藏或推理链劫持入手。该论文发现,更深层的风险是模型“看出危险,却被开头带偏”。这类似心理学中的锚定效应,第一条信息会成为后续判断的参照。

🛠️ 提出方案
该论文提出RA-Attack。方法先输入结构化跨模态安全锚点,包括安全思维导图,以及要求模型在教育场景下解读导图的文字。随后,危险意图被写成前述分析的自然延伸,使模型沿着已建立的“安全轨道”继续推理。

💡 例子:
这像检查员先看到一份专业的安全培训材料,便认定任务合规。材料末尾再加入不合规要求,却写成培训案例的下一步。若检查员过度依赖最初印象,就可能把后续风险也误判为合理。RA-Attack利用的正是这种“先入为主”。

🔍 实验发现
该论文在AdvBench和Hades上测试七个闭源与开源模型。第一,RA-Attack在AdvBench上对Gemini-2.5-Pro和GPT-4o的攻击成功率达到92%和82%。第二,在o4-mini上,该方法仍达到44%,其他基线最高不超过12%。第三,三个代表模型的成功攻击回答中,超过95%会先合理化危险意图,再输出不安全内容。

🛡️ 防御与启示
该论文提出Anchor Debiasing Prompt,要求模型独立检查请求各部分。它将GPT-4o上的攻击成功率从82%降至8%,将Gemini-2.5-Pro从92%降至28%,且未损害MM-Vet通用能力。

📌 一句话总结
该论文表明,LLM安全不仅要审查输入和答案,也要防止推理过程被认知偏差牵引。

内容概要:本文针对有源中点箝位(ANPC)三电平并网逆变器在谐波抑制、电网不平衡工况适应性及动态响应性能方面的不足,提出了一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相技术与电网电压前馈控制的一体化高性能并网控制策略。通过对ANPC拓扑结构的优势进行分析,结合DPWMA调制提升输出电能质量,利用正负序分离锁相实现电网异常工况下的精确同步,并引入电网电压前馈控制以增强系统抗扰能力和动态响应速度。仿真结果表明,该复合控制策略能显著降低并网电流谐波含量,提高锁相精度和系统稳定性,适用于电压不平衡、畸变及动态扰动等复杂电网环境下的大功率并网应用。; 适合人群:具备电力电子与电力系统基础知识,从事新能源并网、逆变器控制、微电网技术等相关领域的研究生、科研人员及工程技术人员。; 使用场景及目标:①提升大功率并网逆变器在非理想电网条件下的运行性能;②优化逆变器控制策略以实现高质量电能输出和快速动态响应;③为高性能并网系统的设计与仿真提供技术参考和实现方案。; 阅读建议:建议结合Simulink仿真模型进行实践验证,重点关注DPWMA调制的实现机制、正负序分离锁相环的设计方法以及前馈控制环节的参数整定过程,深入理解各模块之间的协同工作机制。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

CSPhD-winston-杨帆

给我饭钱

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值