【CVPR 2025】A3:不可学习样本的少样本提示学习,跨模态对抗特征对齐|从数据保护与AI安全视角

摘要

本文解读 CVPR 2025 论文《A3: Few-shot Prompt Learning of Unlearnable Examples with Cross-Modal Adversarial Feature Alignment》。该论文提出自适应不可学习样本框架跨模态对抗特征对齐(A3)防御,通过融合图像增强文本增强元网络(meta-net),系统评估了不可学习样本(UE)在少样本提示学习场景下的有效性,其特别之处在于首次把 UE 攻防双方同时迁移到预训练视觉语言模型(CLIP)的提示学习设置中。实验表明A3 在全部 6 种 UE 攻击下把 Caltech-101 精度恢复到 93–94(相对 CoCoOp 基线最高 +32.5 个百分点),base-to-novel 调和均值最高提升 33%,为数据保护与多模态模型安全提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)A3: Few-shot Prompt Learning of Unlearnable Examples with Cross-Modal Adversarial Feature Alignment
标题(中文)不可学习样本的少样本提示学习:跨模态对抗特征对齐
作者Xuan Wang, Tianrui Qin, Xitong Gao, Yu-liang Lu, Dongping Liao, Cheng-zhong Xu
机构国防科技大学;OPPO 研究院;中科院深圳先进技术研究院;澳门大学
会议CVPR 2025
arXiv无(该论文无 arXiv 预印本,仅 CVPR 官方版本)
项目网站暂无公开项目网站

背景与动机

不可学习样本(Unlearnable Examples, UE)是一种数据保护技术:给图片加上人眼不可感知的微小扰动,使机器学习模型无法从这些数据中有效学到泛化特征,从而阻止未经授权的模型训练,保护内容创作者的版权与个人隐私。与传统数据投毒(backdoor poisoning)不同,UE 不追求恶意后门,而是让数据对训练"不可用"。

然而,已有 UE 方法普遍隐含两个假设:训练者大量接触毒化数据模型从零开始训练(如 EM、REM 用 ResNet-18 从头训练做代理)。这两个假设在现实中越来越不成立——大量训练者改用预训练的视觉语言模型(CLIP),通过提示学习(Prompt Learning, PL)仅用每类几张样本就能适配新类别。那么一个核心问题随之而来:UE 在少样本提示学习下是否仍然有效?

这对攻防双方都有深刻含义: - 对内容创作者:需要知道最少修改多少数据才能维持保护效果;创作者通常只掌握有限数量的数据,自然落入 few-shot 场景。 - 对未经授权的训练者:PL 利用预训练编码器的泛化能力,可能绕过原本让从头训练失效的扰动;且 PL 还能通过文本增强(不只是图像增强)提升鲁棒性。

已有防御(对抗训练 AT、灰度/JPEG 捷径挤压 ISS、随机增强 UEraser)都面向从头训练模型设计,在少样本 PL 场景下缺乏系统评估。这正是 A3 论文的出发点。

研究主线:从问题到结论

A3 研究主线流程图:从 UE 在从头训练下有效,到少样本 PL 打破假设,再到自适应 UE 与跨模态对齐防御

图 3:研究主线(Mermaid 流程图)——问题→动机→设计→方法→实验→结论的完整链条。

基准/方法设计

A3 的工作分为攻击侧与防御侧两块,形成攻防一体的完整框架。

攻击侧:自适应 UE 生成。 代理型 UE 方法(EM、REM、HYPO)原本用从头训练的 ResNet 作代理模型生成扰动。A3 把它们全部改写为以提示学习器为代理:用与防御方相同的 CLIP 和相同的 PL 方法(如 CoCoOp)作为代理,生成对 PL 更强的 UE。实验证明"攻防同假设"是 UE 有效性的关键——自适应 EM 让 CoCoOp 精度从 80+ 跌到 61–70。无代理型方法(LSP、AR、OPS)则直接施加到 PL 训练数据上。

防御侧:跨模态对抗特征对齐。 为每个图像-类别对采样 $K_{im}$ 个图像增强和 $K_{tx}$ 个文本增强,形成 $K_{im}\times K_{tx}$ 个增强对;然后优化提示嵌入 $V$ 与元网络权重,对齐相似度最低(即损失最大)的图像-文本增强对,而不是平均对齐。

A3 方法总览:图像与文本增强各自采样,冻结的 CLIP 双编码器提取特征,跨模态对抗特征对齐以最小相似度对为目标优化提示嵌入与元网络

图 1:A3 总览——图像与文本增强各自采样 $K_{im}$/$K_{tx}$ 条流水线,冻结的 CLIP 双编码器提取特征,跨模态对抗特征对齐以"最小相似度对"为目标优化提示嵌入 $V$ 与 meta-net $m_\psi$。

分类全景

不可学习样本 UE 方法分类:代理型 HYPO/EM/REM 与无代理型 LSP/AR/OPS 及防御方法

图 4:UE 方法分类全景(Mermaid 流程图)——代理型与无代理型攻击,以及 AT/ISS/UEraser/A3 防御。

方法细节

A3 的跨模态对抗特征对齐用 min-max 目标实现:对毒化数据集 $\mathcal{D}{ue}$,最小化期望下的最大损失对 $\min{\phi} \mathbb{E}{(\mathbf{x},y)\sim\mathcal{D}{ue}}[\max_{(i,j)} \mathcal{L}(S(\tilde{\mathbf{x}}i, \tilde{\mathbf{t}}_j), y)]$, $S$ 为余弦相似度矩阵,$\tilde{\mathbf{x}}_i = a{im}(\mathbf{x})$ 是采样图像增强后的图像,$\tilde{\mathbf{t}}j = a{tx}([\mathbf{v}_{j \bmod M}, \mathbf{c}_y])$ 是采样文本增强后的文本嵌入(提示嵌入 $V$ 与类别嵌入 $c_y$ 拼接)。

四个核心设计要素:

  1. 跨模态 min-max 目标:聚焦最不相似的增强对,而非平均对齐——"最难对齐的那一对"驱动学习。
  2. 图像增强池:UEraser 风格,包括裁剪/旋转、分形变换(Tormentor)、TrivialAugment 等。
  3. 文本增强池(A3 独有优势):离散 token 空间的掩码与重排,加上文本嵌入空间的微旋转。图像增强抑制 UE 扰动但有语义保真度权衡,文本增强不受此限制——这正是 A3 显著强于 UEraser 的根源。
  4. Meta-net:$m_\psi(f_{im}(\tilde{\mathbf{x}}))$ 从增强图像特征生成额外 prompt 嵌入,进一步扩大文本增强覆盖。

自适应攻击侧,REM 目标被改写为 $\min_{(\delta, V, \dots)} \max_{\eta} \mathbb{E}[\mathcal{L}(h_\phi(\mathbf{x}i+\delta_i+\eta), y_i)]$;EM 变体去掉内层 $\max\eta$,HYPO 变体进一步固定 $V$ 为手工初始 prompt。

实验设计与结果

评测协议:7 个数据集(ImageNet、Caltech-101、Oxford-Pets、Flowers-102、Food-101、SUN397、UCF-101),覆盖通用/细粒度/场景/动作识别;两种协议——Standard(全类训练)与 Base-to-Novel(基类训练、新类测试,报告 $\alpha_b/\alpha_n/\alpha_h$ 调和均值);少样本设定默认每类 16 样本;CLIP 骨干 ResNet-50 / ViT-B/16,上下文长度 $T{=}4$,提示嵌入 $M{=}1$。

主结果(Caltech-101,16 shots)——不同 UE 攻击下各防御的干净测试精度:

UE 方法CoCoOp 基线仅文本增强仅图像增强Full (A3)
EM (8/255)75.5384.6992.5194.28
REM (8/255)52.3386.8992.3293.88
HYPO (8/255)47.3684.0791.4793.21
LSP (1.30)43.2383.3792.8394.02
AR (1.00)50.1884.9691.6393.41
EM (16/255)59.3682.4590.4091.86

基类到新类(Base-to-Novel)——A3 相对 CoCoOp 的 $\alpha_h$ 提升:代理型 UE(EM/REM/HYPO)下高 15%–33%,无代理型(LSP/AR/OPS)下高 6%–30%;以 HYPO 为例,A3 把 $\alpha_b$ 从 52.01 提升到 85.08(Δ=+33.07)。

部分投毒场景:A3(右列)在 4 种 UE 方法下各精度指标稳定,CoCoOp(左列)随投毒率升高明显退化

图 2:部分投毒($R\in{\frac18,\frac14,\frac12,1}$)——A3(右列)各指标($\alpha_{unlearn}/\alpha_{original}/\alpha_{test}/\alpha_{train}$)稳定,CoCoOp(左列)随投毒率升高明显退化。

结果对比总结

A3 结果对比总结:CoCoOp 基线 75.53 经文本增强、图像增强到 A3 Full 94.28 的逐步提升

图 5:结果对比总结(Mermaid 流程图)——从基线到完整 A3 的精度提升路径。

关键发现

  1. 少样本 PL 天然对抗传统 UE:面向 ResNet-18 从零训练的原版 EM(EM-0)在提示学习下几乎失效($S{=}2$ 时 CoCoOp 仍有 78.23 平均精度),说明预训练 VLM 的泛化能力部分绕过 UE 扰动。
  2. "攻防同假设"是关键:把提示学习器当作代理模型后,自适应 EM 让 CoOp/CoCoOp/ProDA/KgCoOp 精度大幅下降(EM 自适应下 CoCoOp 仅 61.78–64.13),证明 UE 有效性强烈依赖训练范式匹配。
  3. 双模态缺一不可:以 EM (8/255) 为例,仅文本增强 84.69、仅图像增强 92.51、两者组合 94.28——图像增强抑制扰动,文本增强补足语义保真度权衡。
  4. 大扰动预算下依然稳健:EM 扰动从 8/255 翻倍到 16/255,A3 仍有 91.86,比基线 59.36 高 32.5 个百分点。
  5. 部分投毒鲁棒性:投毒率从 1/8 到 100% 变化时,A3 各精度指标稳定,能学习到底层特征;CoCoOp 随投毒率升高明显退化——更贴近真实混合数据场景。
  6. 新类泛化大幅领先:7 数据集 base-to-novel 全胜,$\alpha_h$ 较 CoCoOp 高 15%–33%,说明 A3 学到的是任务级特征而非记忆毒化样本。

局限性

  • 代理一致性假设:自适应 UE 假设攻击者知道防御方用哪款 CLIP 与 PL 方法——现实中代理不匹配时攻击强度下降,这既是局限也是防御方的潜在优势。
  • 扰动预算敏感:$\ell_\infty$ 16/255 预算下即使 A3 也明显回落(HYPO 从 93.21 到 89.33);对抗训练 AT 在 $\ell_2$/$\ell_0$ 攻击(LSP/AR/OPS)上基本无能为力。
  • 任务范围有限:主要评估图像分类;视频、音频等模态与检测、分割等任务尚未验证。
  • 评估成本:攻防两端都依赖 CLIP 特征提取,$K_{im}\times K_{tx}$ 个增强对带来额外训练开销。

常见问题(FAQ)

什么是不可学习样本(UE)?

UE 是给图片加上人眼不可感知的微小扰动、让机器学习模型无法从中有效学习的数据。它不同于恶意后门投毒,是内容创作者保护版权与隐私的手段——数据对模型"不可学",但对人依然可用。

A3 和 UEraser 有什么区别?

两者都是 UE 防御,但 UEraser 只用图像增强,且增强策略要在"语义保真度"与"抑制扰动"之间权衡。A3 在图像增强之外新增了文本增强(token 掩码/重排、嵌入微旋转)与 meta-net,文本侧不受图像语义权衡限制,因此双模态组合显著更强(EM 8/255 下 94.28 vs UEraser 90.37)。

为什么原版 EM 在提示学习下失效?

原版 EM 用 ResNet-18 从头训练合成扰动,假设训练者也从头训练。但提示学习使用预训练 CLIP 的冻结编码器,其零样本泛化能力让扰动无法有效抑制特征学习——预训练知识"绕过"了 UE。

什么是 base-to-novel 协议?

把数据集的类别分成两个不重叠的组:基类(base)用于训练提示学习模型,新类(novel)只用于测试。报告基类精度 $\alpha_b$、新类精度 $\alpha_n$ 与调和均值 $\alpha_h$,用来验证模型的泛化能力。

A3 能用在真实场景吗?

论文用部分投毒实验模拟真实场景:数据集中只有一部分被毒化(1/8 到全部)时,A3 依然稳定学到特征,而 CoCoOp 明显退化。这对应现实中训练者从多渠道收集数据的场景,A3 的实用价值更突出。

这个论文有代码或 arXiv 吗?

该论文没有 arXiv 预印本,仅以 CVPR 2025 官方版本发布,目前没有公开项目网站或代码仓库。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

内容概要:本文提出了一种基于“空调-电动汽车”联合虚拟储能的海岛微电网优化调度方法,旨在解决海岛地区能源供给不稳定及可再生能源波动性大的挑战。通过综合利用空调负荷的热惰性电动汽车的灵活充放电能力,构建联合虚拟储能系统,有效提升微电网对风电、光伏等间歇性电源的消纳能力,并增强系统的调节灵活性和运行经济性。研究建立了涵盖发电侧、负荷侧储能侧协同互动的多目标优化调度模型,综合考虑用户舒适度、出行需求、设备运行约束等因素,采用Matlab进行仿真验证,实现了系统运行成本降低、弃风弃光减少以及能源利用效率提升的目标。该方法充分挖掘了需求侧资源的潜在储能价值,为偏远地区独立微电网的安全、低碳、经济运行提供了有效的技术路径。; 适合人群:具备一定电力系统基础知识和Matlab编程能力,从事微电网、综合能源系统、虚拟储能或需求侧响应相关研究的研究生及科研人员。; 使用场景及目标:①应用于海岛、偏远地区等独立微电网的优化调度设计;②研究如何利用温控负荷电动汽车协同提供虚拟储能服务;③实现可再生能源高比例消纳系统经济性运行的平衡; 阅读建议:建议结合Matlab代码深入理解模型构建细节,重点关注目标函数设定、约束条件处理以及空调电动汽车建模方法,可进一步拓展至多时间尺度调度或引入不确定性因素进行改进研究。
内容概要:本文围绕“基于多维核密度估计的光伏-负荷场景生成方法”展开研究,提出利用多维核密度估计技术对光伏发电电力负荷的不确定性进行建模,生成高精度、高还原度的典型运行场景。该方法能够有效捕捉光伏出力负荷需求之间的时空相关性及时变特性,克服传统场景生成方法中对数据分布假设过强、忽略变量间依赖关系等局限性。研究通过Matlab编程实现了完整的场景生成流程,涵盖数据预处理、多维核密度估计建模、随机场景抽样及场景削减等关键环节,并结合实测数据验证了所提方法在提升场景代表性、减少冗余场景数量以及增强优化模型求解效率方面的显著优势。; 适合人群:具备一定电力系统基础知识和Matlab编程能力的研究生、科研人员及从事新能源并网、微电网优化、综合能源系统等领域的工程技术人员。; 使用场景及目标:①用于可再生能源接入背景下的电力系统随机优化、鲁棒优化等需要输入典型场景的研究应用;②支撑微电网调度、储能配置、需求响应等场景下的不确定性建模仿真分析;③为学术论文复现、课题研究提供可靠的技术路径代码支持。; 阅读建议:建议读者结合文中提供的Matlab代码进行实践操作,重点关注多维核密度估计的实现细节场景削减算法的应用逻辑,同时可参考文档中列出的其他相关研究方向以拓展技术视野。
内容概要:本文针对传统三电平并网逆变器存在的谐波含量高、电网不平衡工况适应性差及动态响应滞后等问题,以有源中点箝位(ANPC)三电平逆变器为研究对象,提出一套融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相电网电压前馈的复合控制策略。文章系统阐述了ANPC拓扑的结构优势,详细设计了DPWMA调制机制以提升等效开关频率、降低输出谐波;采用正负序分离锁相技术实现不平衡电网下的精确相位同步,抑制负序分量引起的功率振荡;引入电网电压前馈控制增强系统对电压扰动的快速响应能力,改善动态性能。通过Simulink平台搭建仿真模型,在稳态、电网不平衡及动态扰动等多种工况下验证了所提策略的有效性,结果表明该方案能显著提升并网电能质量、增强系统稳定性和抗扰能力,适用于新能源并网、工业大功率变流等复杂应用场景。; 适合人群:具备电力电子电力系统基础知识,熟悉Matlab/Simulink仿真环境的高校研究生、科研人员及从事新能源并网、逆变器控制研发的工程技术人员。; 使用场景及目标:①掌握ANPC三电平逆变器的拓扑特性建模方法;②学习DPWMA调制、正负序分离锁相、电网前馈等先进控制技术的原理实现;③为高电能质量并网系统的设计优化提供技术参考和仿真案例支持。; 阅读建议:建议读者结合文中提供的完整仿真资源,按照目录结构逐步实践各控制模块的搭建调试,重点关注不同工况下的波形对比分析,深入理解复合控制策略的作用机理,并可进一步拓展至低电压穿越、多机并联等实际工程问题的研究。
内容概要:本文针对有限控制集约束下的三相并网逆变器,深入研究了电流功率双模态模型预测控制(MPC)的等效机理及其性能边界,结合Simulink仿真Matlab代码实现,系统分析了在不同运行条件下逆变器的动态响应、稳定性表现及控制精度。研究构建了电流-功率双模式MPC统一控制框架,有效实现了并网电流畸变抑制功率无差拍响应的协同调控,揭示了两种控制模式之间的内在等效关系自适应切换机制,并通过理论推导仿真实验界定了控制系统的性能极限稳定边界,为高比例新能源并网系统的高性能控制提供了坚实的理论依据技术支撑。; 适合人群:具备电力电子、自动控制理论及新能源并网技术背景,熟练掌握Matlab/Simulink仿真工具,从事电力系统自动化、可再生能源并网控制等领域研究的研究生、高校科研人员及工程技术人员。; 使用场景及目标:①深入理解有限控制集模型预测控制(FCS-MPC)在三相并网逆变器中的应用原理设计方法;②掌握电流功率双目标预测控制的建模、代价函数设计、预测时域优化及仿真验证全流程;③探究控制性能的边界条件系统稳定性机理,为实际工程中提升电能质量并网可靠性提供优化策略。; 阅读建议:建议结合文中提供的Matlab代码Simulink仿真模型进行动手实践,重点剖析双模态控制的切换逻辑、预测模型构建过程及参数敏感性分析,通过对比不同工况下的仿真结果,深入理解控制策略的动态特性鲁棒性表现。
内容概要:本文针对传统三电平并网逆变器在谐波抑制、电网不平衡工况适应性及动态响应方面的不足,以有源中点箝位(ANPC)三电平逆变器为研究对象,提出一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相电网电压前馈控制的复合控制策略。通过深入分析ANPC拓扑的结构特征,充分发挥其在开关损耗均衡、输出波形质量及中点电位可控性方面的固有优势。在此基础上,采用DPWMA调制提升等效开关频率,显著降低输出电流谐波含量;引入正负序分离锁相技术,实现电网电压正负序分量的精准解耦,确保在电网不平衡条件下仍能维持精确的相位同步;结合电网电压前馈控制,构建前馈-反馈复合控制体系,有效抑制电网电压扰动对并网电流的影响,大幅缩短系统动态响应时间,提升抗扰能力。最终通过Simulink平台搭建完整的仿真模型,对系统在稳态运行、电网电压不平衡及动态工况切换等多种场景下进行了全面验证,结果表明该复合控制策略能显著提升并网电能质量系统整体稳定性。; 适合人群:电力电子、新能源并网、自动化及相关专业的研究生、科研人员及从事逆变器控制算法开发的工程技术人员。; 使用场景及目标:① 提升大功率并网逆变器在复杂电网环境下的运行性能;② 解决电网电压不平衡导致的锁相偏差功率波动问题;③ 优化并网电流波形质量,满足高电能质量标准;④ 为ANPC等多电平逆变器的高性能控制提供仿真设计参考。; 阅读建议:建议结合Simulink仿真模型同步学习,重点关注DPWMA调制实现逻辑、正负序分离锁相环设计及前馈-反馈复合控制结构的搭建,可通过对比实验深入理解各项技术对系统性能的提升效果。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值