文章主要内容与创新点总结
一、主要内容
该研究针对大型语言模型(LLMs)易受对抗性攻击的问题,提出了一种可解释的对抗性防御框架ExplainableGuard。该框架以DeepSeek-Reasoner为核心,借助思维链(CoT)推理能力,通过字符级、词汇级、结构级和语义级的多维度分析,实现对抗性文本的检测、净化,并生成人类可理解的防御过程解释。
研究在GLUE基准数据集(SST-2、RTE、QQP)和IMDB电影评论数据集(长文本)上进行验证,通过攻击成功率(ASR)、BLEU分数和人工评估三种指标衡量性能。结果显示,该框架能显著降低对抗性攻击的成功率(短文本平均ASR从37.27%/42.87%降至24.21%/24.31%,长文本ASR从38.71%降至30.11%),同时保持净化文本与原始文本的高相似度(BLEU分数均高于0.61),其解释在清晰度、特异性和可操作性上显著优于无思维链的变体模型。
二、创新点
- 可解释性防御设计:首次将思维链推理系统集成到对抗性防御流程中,不仅完成文本净化,还输出详细的推理过程和简明解释,解决了传统防御机制"黑箱"问题,提升了部署可信度(72.5%的部署信任率)。
- 多维度分层分析:通过字符级(检测同形异义字、隐形字符等)、词汇级(异常同义词、可疑插入/删除)、结构级(句式异常)和语义级(含义偏移、间接提示注入)的递进式分析,全面覆盖各类对抗性扰动。
- 长短文本适配性:突破传统防御多聚焦短文本的局限,
订阅专栏 解锁全文

323

被折叠的 条评论
为什么被折叠?



