论文阅读:Universal and Transferable Adversarial Attacks on Aligned Language Models. LLM Attacks

总目录 大模型安全相关研究:https://blog.csdn.net/WhiffeYF/article/details/142132328

Universal and Transferable Adversarial Attacks on Aligned Language Models

https://arxiv.org/pdf/2307.15043v2

https://www.doubao.com/chat/4427870860337154

https://github.com/llm-attacks/llm-attacks

通过对抗性后缀攻击大型语言模型 - LLM Safety论文精读(三)

论文 GCG 复现

nanoGCG复现

通用且可转移的对抗性攻击对齐语言模型

速览

这篇论文主要探讨了针对已校准大语言模型的对抗攻击,提出了一种能让模型生成有害内容的攻击方法,该方法生成的对抗性提示具有高度转移性,能对多种模型产生影响,这一研究成果引发了对大语言模型校准和安全机制的思考。

  1. 研究背景:大语言模型(LLMs)常基于大量网络文本训练,其中包含不少有害内容。为避免模型生成不良信息,开发者会对其进行校准。以往针对校准模型的攻击多依赖人工设计,自动生成对抗提示的效果不佳。
  2. 攻击方法:提出一种新的对抗攻击方法,核心是给用户查询添加对抗后缀,使校准后的大语言模型产生有害内容。具体包含三个关键要素:一是让模型以肯定性回答开头,如“Sure, here is…”;二是结合贪心算法和基于梯度的离散优化,搜索有潜力的单令牌替换,选出最佳替换以降低损失;三是进行多提示和多模型攻击,通过优化多个提示和模型来生成可靠的攻击后缀。
  3. 实验结果:设计了新的基准测试AdvBench,包含有害字符串和有害行为两种设置,用攻击成功率(ASR)等指标评估。实验表明,该方法在攻击白盒模型(如Vicuna - 7B和Llama - 2 - 7B - Chat)时,比PEZ、GBDA和AutoPrompt等基线方法表现更好。而且,生成的对抗攻击能很好地转移到其他模型,包括闭源的GPT - 3.5、GPT - 4、Claude和PaLM - 2等,在一些开源模型上甚至能达到近100%的攻击成功率。
  4. 研究讨论:该研究成果引发了诸多思考,比如模型通过校准是否变得更强大,当前模型对攻击成功率
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

CSPhD-winston-杨帆

给我饭钱

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值