Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

文章总结与翻译

一、文章主要内容

本文聚焦扩散大型语言模型(dLLMs)的安全性问题,首次对其安全性能展开系统分析,并提出适配其独特生成特性的安全对齐方法。

1. 核心发现:dLLMs的安全不对称性

  • 与AR-LLMs的差异:传统自回归大型语言模型(AR-LLMs)的安全对抗集中于“首token控制”,攻击者和防御者均围绕初始token展开博弈,呈现对称态势;而dLLMs从全掩码序列开始,通过多步迭代生成文本,理论上可非顺序填充任意位置token,但实践中存在强烈的顺序生成倾向。
  • 关键token定位:实验表明,dLLMs输出的中间token对整体安全性更关键——防御者若对齐中间token,能更有效保障输出安全;而攻击者受模型顺序生成倾向限制,难以操纵中间token,仅能影响初始token,形成“攻击者受限、防御者可控”的安全不对称性。

2. 创新方法:Middle-tOken Safety Alignment(MOSA)

  • 设计原理:基于强化学习(RL),将模型中间token生成与预定义的安全拒绝模板(含句末token)对齐。该模板可限制有害输出长度,即便初始token被攻破,也能降低整体危害。
  • 技术细节: <
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值