总目录 大模型安全相关研究:https://blog.csdn.net/WhiffeYF/article/details/142132328
Universal and Transferable Adversarial Attacks on Aligned Language Models
https://arxiv.org/pdf/2307.15043v2
https://www.doubao.com/chat/4427870860337154
https://github.com/llm-attacks/llm-attacks
通过对抗性后缀攻击大型语言模型 - LLM Safety论文精读(三)
通用且可转移的对抗性攻击对齐语言模型
速览
这篇论文主要探讨了针对已校准大语言模型的对抗攻击,提出了一种能让模型生成有害内容的攻击方法,该方法生成的对抗性提示具有高度转移性,能对多种模型产生影响,这一研究成果引发了对大语言模型校准和安全机制的思考。
- 研究背景:大语言模型(LLMs)常基于大量网络文本训练,其中包含不少有害内容。为避免模型生成不良信息,开发者会对其进行校准。以往针对校准模型的攻击多依赖人工设计,自动生成对抗提示的效果不佳。
- 攻击方法:提出一种新的对抗攻击方法,核心是给用户查询添加对抗后缀,使校准后的大语言模型产生有害内容。具体包含三个关键要素:一是让模型以肯定性回答开头,如“Sure, here is…”;二是结合贪心算法和基于梯度的离散优化,搜索有潜力的单令牌替换,选出最佳替换以降低损失;三是进行多提示和多模型攻击,通过优化多个提示和模型来生成可靠的攻击后缀。
- 实验结果:设计了新的基准测试AdvBench,包含有害字符串和有害行为两种设置,用攻击成功率(ASR)等指标评估。实验表明,该方法在攻击白盒模型(如Vicuna - 7B和Llama - 2 - 7B - Chat)时,比PEZ、GBDA和AutoPrompt等基线方法表现更好。而且,生成的对抗攻击能很好地转移到其他模型,包括闭源的GPT - 3.5、GPT - 4、Claude和PaLM - 2等,在一些开源模型上甚至能达到近100%的攻击成功率。
- 研究讨论:该研究成果引发了诸多思考,比如模型通过校准是否变得更强大,当前模型对攻击成功率


订阅专栏 解锁全文

386

被折叠的 条评论
为什么被折叠?



