【CVPR 2025】MMRL:多模态表示学习,让 CLIP 少样本适配不再过拟合|从少样本视觉识别专家视角

摘要

本文解读 CVPR 2025 论文《MMRL: Multi-Modal Representation Learning for Vision-Language Models》。该论文提出多模态表示学习(MMRL)框架,通过融合共享可学习表示空间表示 token 高层注入类 token 余弦正则,在少样本(16-shot)条件下既提升任务适配精度又保住预训练泛化能力,其特别之处在于训练与推理的解耦策略:表示 token 学任务、类 token 保泛化。实验表明11 个数据集 base-to-novel 调和平均达到 81.20,基类精度 85.68,全面刷新 SOTA,且 ImageNet 16-shot 训练仅需 3.6 分钟,为视觉语言模型的高效迁移学习提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)MMRL: Multi-Modal Representation Learning for Vision-Language Models
标题(中文)多模态表示学习:让 CLIP 少样本适配不再过拟合
作者Yuncheng Guo, Xiaodong Gu
机构复旦大学电子工程系
会议CVPR 2025
arXivhttps://arxiv.org/abs/2503.08497
项目网站https://github.com/yunncheng/MMRL

背景与动机:为什么 CLIP 少样本适配会过拟合?

大规模预训练的视觉语言模型(VLM)如 CLIP,用 4 亿图文对做对比学习,具备强大的零样本能力。但把它迁移到下游任务时,训练数据往往很少(每类仅 16 张图),于是出现一对矛盾:适配得越用力,过拟合越严重,零样本泛化损失越大

现有适配路线主要有两条,都有共同的隐含假设——只优化类 token 特征:

  • 提示学习:CoOp(IJCV 2022)把手工模板换成可学习连续向量;CoCoOp(CVPR 2022)用视觉线索生成实例级提示;MaPLe(CVPR 2023)在多个层同时加图文提示;PromptSRC(ICCV 2023)加自正则约束。问题:深层提示从文本侧映射视觉,本质仍是文本中心,少样本下基类涨点但新类掉得厉害(CoOp 的 Novel 精度从零样本 74.22 掉到 63.22)。
  • 适配器风格:CLIP-Adapter、Tip-Adapter 在输出端加轻量 MLP;MMA(CVPR 2024)把跨分支特征聚合到共享空间,允许梯度跨模态流动。问题:只在输出端做特征聚合,编码器内部没有真正的跨模态交互。

从历史视角看,这条技术线从 CLIP(2021)确立零样本基线,到 CoOp/CoCoOp(2022)开创提示学习,再到 MaPLe/PromptSRC/TCP(2023–2024)走向深层多模态提示与共享特征空间,始终没有跳出"改输入提示"或"改输出特征"的框架。MMRL 的答案是:在编码器内部建一个共享可学习表示空间,让双模态在深层语义层真正交互。

研究主线:从问题到结论

MMRL 研究主线:从过拟合问题到全面 SOTA 结论的流程图

图 5:MMRL 研究主线流程图(Mermaid)——问题、动机、设计、方法、实验、结论

基准/方法设计:一个空间,两个模态

MMRL 维护一个共享、可学习、模态无关的表示空间 $\mathcal{R}$:里面放 $K$ 个高斯初始化的空间 token(默认 $K=5$,维度 $d_r=512$),通过两个线性映射函数 $\mathcal{F}$ 分别投影成图像表示 token 和文本表示 token。从第 $J=6$ 个 Transformer 层开始,这些 token 被拼进冻结的 CLIP 编码器序列——低层保持纯净以保留通用视觉/文本知识,高层注入任务特定表示

训练时只优化三部分:表示空间 $\mathcal{R}$、映射函数 $\mathcal{F}$、表示 token 的 patch 投影层;整个预训练 CLIP 完全冻结。文本编码器是自回归结构,因此还要调整注意力掩码以容纳更长的 token 序列。

MMRL 训练框架:共享表示空间经线性映射注入图文编码器高层

图 1:MMRL 训练框架:共享表示空间经线性映射注入图文编码器高层(C 类 token,B/EOT 文本边界,R 表示 token)

分类全景:VLM 高效适配的三条路线

VLM 高效适配三路线:提示学习、适配器与 MMRL 表示学习分类图

图 6:VLM 高效适配三路线分类图(Mermaid)——提示学习 / 适配器 / 表示学习

方法细节:解耦训练与推理

MMRL 的核心是解耦策略,让"学任务"和"保泛化"各司其职:

  • 训练阶段:表示特征走可训练投影层,类特征走冻结投影层,分别计算交叉熵损失 $\mathcal{L}_c$ 与 $\mathcal{L}_r$;同时用余弦正则把类特征 $(f_c, w)$ 拉向冻结 CLIP 特征 $(f_0, w_0)$。总损失为 $\mathcal{L} = \alpha \mathcal{L}_c + (1-\alpha) \mathcal{L}_r + \lambda(\mathcal{L}_v + \mathcal{L}_t)$,默认 $\alpha=0.7$,ImageNet 上 $\lambda=0.5$。
  • 基类推理:训练见过的类别,融合两种特征 $p(y|x) = \alpha p(y|f_c) + (1-\alpha) p(y|f_r)$——任务特定知识与通用知识互补。
  • 新类推理:未见过的类别,只用类特征 $p(y|f_c)$——因为表示 token 学的是数据集特定分布,直接用于新类会过拟合。

MMRL 推理过程:不同任务使用不同特征

图 2:MMRL 推理过程:不同任务使用不同特征(base 类融合、novel 类仅类特征)

实现细节:ViT-B/16 骨干,AdamW 优化器(学习率 $10^{-3}$),混合精度训练;ImageNet 上 batch size 32、5 个 epoch,其余数据集 batch size 4、10 个 epoch;三次运行取平均,全部实验单张 RTX 4090 完成。

实验设计与结果:四项评测全部 SOTA

实验覆盖四类评测,默认 16-shot:base-to-novel(11 个数据集类别对半切分)、跨数据集(ImageNet 1000 类训练后直接用到其余 10 个数据集)、域泛化(ImageNet → V2/Sketch/A/R)、少样本(每类 1/2/4/8/16 shot)。

base-to-novel 平均结果(主表):

方法BaseNovelHM
CLIP(零样本)69.3474.2271.70
CoOp82.6963.2271.66
MaPLe82.2875.1478.55
PromptSRC84.2676.1079.97
MMA83.2076.8079.87
MMRL(本文)85.6877.1681.20

MMRL 在平均 Base(+2.48pp)、Novel(+0.36pp)、HM(+1.33pp)三项全面超过上一 SOTA MMA,11 个数据集的调和平均全部最佳——雷达图完整包裹所有基线。值得注意的是 CoOp 基类 82.69 但新类只有 63.22,说明只优化类 token 的提示方法过拟合严重;MMRL 在两者间取得最佳平衡。

少样本学习对比:MMRL 全部 shot 设置下平均精度最高

图 3:少样本学习对比:MMRL 在全部 shot 设置(1/2/4/8/16)下平均精度最高,且随 shot 数增多优势扩大

  • 跨数据集:ImageNet 源域 72.03(+1.03pp 超 MMA),10 个目标数据集平均 67.25 为最高。
  • 域泛化:ImageNet-V2 64.47、ImageNet-A 51.20 两个偏移集取得最佳。
  • 少样本:全部 shot 设置平均精度最高,且 shot 数越多优势越大。

消融实验:注入层位置 J 与 token 数量 K

图 4:消融实验:左——表示 token 注入层位置 J;右——表示 token 数量 K

附录消融细节(全部在 11 数据集 base-to-novel 上平均):注入层 $J=6$ 最优——过低(如第 2 层)基类精度明显下降,说明低层特征不可适配;过高则可学习参数减少、容量不足。token 数 $K=5$ 最优,过多导致新类精度回落。表示维度 $d_r=512$ 最优(EuroSAT 用 2048),继续增大出现过拟合。$\alpha$ 扫描 0.0→1.0 中 0.7 最优(HM 81.20,两端分别掉到 77.29 和 79.42);$\lambda$ 在 ImageNet 上 0.5 最优(HM 74.45)。正则策略对比中余弦正则(81.20)显著优于 L1(80.47)与 MSE(79.53),因为余弦约束更松弛,类 token 保泛化的同时仍能捕捉任务知识。

附录 A 计算开销(ImageNet 16-shot,单张 RTX 4090):

方法可训练参数训练(ms/图)FPSHM
MaPLe3.555M39.51757.678.55
PromptSRC0.046M40.01764.279.97
ProVP0.147M4.4928.978.76
TCP0.332M5.3950.679.51
MMA0.675M2.2688.579.87
MMRL4.992M5.3762.481.20
MMRL*($d_r=32$)0.689M5.3767.880.84

MMRL 整轮 ImageNet 16-shot 训练仅 3.6 分钟;把 $d_r$ 压到 32 后参数与 MMA 持平(0.689M),HM 仍有 80.84,说明成本可按需压缩。

结果对比总结

MMRL 与基线 HM 对比:从 71.70 到 81.20 的提升路径图

图 7:结果对比总结图(Mermaid)——CLIP 71.70 → CoOp 71.66 → MMA 79.87 → MMRL 81.20

关键发现

  • 解耦策略是收益核心:去掉解耦(只用类特征,w/o DS₁)基类精度从 85.68 掉到 83.59;只用表示特征($\alpha=0$)HM 掉到 77.29。
  • 双模态交互不可或缺:仅图像侧(w/o L)HM 80.08、仅文本侧(w/o V)HM 78.74,都比双模态联合的 81.20 低——共享空间必须同时服务两个编码器。
  • 效率与性能可兼得:4.99M 参数、5.3 ms/图训练、762 FPS 推理,HM 81.20;压缩到 0.689M 参数仍有 80.84,优于同规模的 MMA(79.87)。
  • 少样本优势随数据扩大:1-shot 平均 72.67、16-shot 平均 85.08 附近的全 shot 最佳表现,说明表示学习能有效利用每一张新增样本。
  • 跨域迁移稳健:ImageNet 训练直接迁移到 10 个目标数据集平均 67.25,域泛化 4 个偏移集拿下 2 个第一。

局限性

  • 实验只在 CLIP ViT-B/16 一个骨干上验证,未覆盖更大模型或其他 VLM(如 SigLIP、EVA-CLIP)。
  • 可训练参数 4.99M 明显高于 MMA 的 0.675M;压缩到 $d_r=32$ 虽有缓解,仍非零成本。
  • 表示维度、注入层、$\alpha$、$\lambda$ 等超参数需要按数据集微调(如 EuroSAT 用 $d_r=2048$)。
  • Novel 精度并非每个数据集都最高:FGVCAircraft 上落后 PromptSRC 0.84pp(但基类高 3.57pp)。
  • 作者展望更参数高效的表示学习与模态内交互,即后续工作 MMRL++(IJCV 2026)。

常见问题(FAQ)

MMRL 和 MMA 有什么区别?

MMA 在输出端把跨分支特征聚合进共享空间,本质是特征融合;MMRL 在编码器内部(第 6 层起)注入可学习的表示 token,让图文双模态在深层 Transformer 中真正交互,并且用解耦策略分开优化表示特征与类特征。

为什么表示 token 只注入高层编码器?

低层编码器保存的是通用、可迁移的视觉/文本知识,注入任务特定 token 会破坏它们;高层特征本身偏数据集特定、可塑性强。消融显示注入层太低时基类精度明显下降,第 6 层是最佳折中。

解耦策略在推理时如何工作?

对训练见过的基类,融合类特征与表示特征的概率($\alpha=0.7$ 加权);对未见的新类,只用类特征。因为表示 token 学的是数据集特定分布,直接用于新类会过拟合,而类特征被余弦正则约束在预训练特征附近,保留了零样本能力。

MMRL 需要多少训练资源?

单张 RTX 4090 即可完成全部实验。ImageNet 16-shot 整轮训练约 3.6 分钟,每张图训练 5.3 毫秒;推理 762 FPS。

MMRL 的代码开源了吗?

开源了。官方实现位于 github.com/yunncheng/MMRL,并包含延伸工作 MMRL++。

MMRL 的主要局限是什么?

骨干单一(仅 CLIP ViT-B/16)、可训练参数偏高(4.99M vs MMA 0.675M)、超参数需按数据集调,以及新类精度并非处处最高。

参考链接

  • arXiv 摘要页:https://arxiv.org/abs/2503.08497
  • 官方代码(含 MMRL++):https://github.com/yunncheng/MMRL
  • CLIP(ICML 2021):https://arxiv.org/abs/2103.00020
  • CoOp(IJCV 2022):https://arxiv.org/abs/2109.01134
  • MaPLe(CVPR 2023):https://arxiv.org/abs/2210.03117
  • MMA(CVPR 2024):https://arxiv.org/abs/2405.16904

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

内容概要:本文围绕基于Transformer模型的电力负荷预测展开研究,提出了一种利用Transformer架构进行负荷预测的方法,并提供了完整的Python代码实现。文章详细阐述了Transformer在处理时间序列数据方面的独特优势,如强大的长期依赖捕捉能力和高效的并行化训练机制,相较于传统的RNN或LSTM模型在预测精度、收敛速度和稳定性方面表现更优。研究涵盖了从原始数据预处理、特征工程构建、模型结构设计到训练优化及预测结果评估的全流程,重点剖析了编码器-解码器结构、自注意力机制、位置编码等核心技术在负荷预测任务中的具体应用与实现细节,并通过真实电力负荷数据集验证了该方法在短期和中期负荷预测场景下的有效性和鲁棒性。; 适合人群:具备一定Python编程基础和机器学习、深度学习理论知识,从事电力系统分析、能源管理、智能电网、时序预测等相关领域的科研人员及工程技术人员,特别适合工作1-3年、希望深入掌握先进深度学习模型在能源领域实际应用的研发人员。; 使用场景及目标:①应用于电力系统短期或中期负荷预测任务,辅助电网调度、发电计划制定和能源市场交易,提升电力系统运行的智能化与精细化水平;②为研究者和开发者提供一个基于Transformer的时间序列预测完整实践范例,帮助深入理解其建模范式、关键组件的设计原理及超参数调优策略;③推动深度学习特别是注意力机制在电力负荷预测及其他能源时序数据分析中的创新应用与技术迭代。; 阅读建议:建议读者结合所提供的Python代码逐模块复现整个建模流程,重点关注输入序列的滑动窗口构造、位置编码的实现方式、多头注意力机制的计算过程以及损失函数的选择,同时鼓励在不同地区、不同季节的负荷数据集上进行迁移实验,以全面评估模型泛化能力,并尝试引入外部变量(如天气、节假日)进一步优化预测性能。
内容概要:本文围绕“计及电气热综合需求响应的区域综合能源系统优化调度”展开研究,提供了完整的Matlab代码实现方案,旨在通过模型复现帮助科研人员深入掌握综合能源系统的优化调度方法。研究聚焦于电力、燃气、热力等多种能源形式的协同优化,充分考虑用户侧的需求响应机制,构建了包含多种能源转换设备、储能装置及多类型负荷的区域综合能源系统模型。以系统运行经济性、能源利用效率和碳排放最小化为多重优化目标,建立了精细化的数学模型,并采用Matlab进行编程求解,实现了在不同场景下的优化调度仿真与性能对比分析,为提升系统综合效益、促进清洁能源消纳及实现低碳化运行提供了有效的技术路径与决策支持。; 适合人群:具备电力系统、能源系统、优化理论或运筹学等相关基础知识,从事综合能源系统、微电网、需求响应、低碳调度等方向研究的研究生、高校科研人员及能源领域的工程技术人员。; 使用场景及目标:① 学习和复现区域综合能源系统优化调度的经典建模思路与算法实现过程;② 掌握Matlab在多能流耦合系统建模、求解器调用与结果可视化方面的综合应用能力;③ 支持开展电气热综合需求响应相关的科研项目、论文撰写与工程实践;④ 为构建更复杂的多区域协同、不确定性优化或博弈调度模型提供可靠的代码基础与技术参考。; 阅读建议:此资源以Matlab代码为核心载体,结合详细的模型说明与结果分析,建议读者按照文档目录结构逐步研读,结合代码注释理解变量定义、约束构建与目标函数设定的逻辑,重点关注需求响应建模与多能耦合环节的实现方式,并可通过调整负荷参数、设备配置或优化目标等方式拓展模型,以适应自身的研究需求,同时可利用提供的网盘链接下载完整资源进行深入学习与验证。
内容概要:本文系统阐述了基于遗传算法优化长短记忆网络(GA-LSTM)的电力系统负荷预测方法,该模型通过遗传算法(GA)对LSTM的关键超参数进行全局寻优,有效克服了传统LSTM依赖经验调参的局限性,显著提升了预测的精度与鲁棒性。研究内容涵盖了完整的数据预处理流程、GA-LSTM混合模型的架构设计、遗传算法的优化机制以及详细的实验验证过程,并利用Matlab代码实现了整个算法流程。文中通过对比实验验证了GA-LSTM模型相较于单一LSTM及其他传统预测模型在预测准确性上的优越性能。; 适合人群:具备一定电力系统基础知识和Matlab编程能力,从事科研或工程应用的研发人员、研究生及高年级本科生。; 使用场景及目标:①应用于电力系统短期或中期负荷预测,为电网调度、发电计划制定提供科学依据,提高电网运行的经济性与安全性;②为新能源并网、电力市场运营、需求侧管理等业务提供精准的负荷数据支持;③学习并掌握智能优化算法(如遗传算法)与深度学习模型(如LSTM)融合的技术路径与实现方法,拓展在时序预测领域的研究与应用能力。; 阅读建议:读者应结合提供的Matlab代码进行实践操作,重点关注遗传算法优化LSTM超参数的具体实现过程、模型训练细节及性能评估指标的分析,建议在深刻理解模型原理的基础上,尝试调整算法参数或将其迁移应用于其他时间序列预测问题,以深化理解和掌握。
内容概要:本文围绕基于电流-功率双模式模型预测控制(MPC)的三相并网逆变器闭环控制策略展开研究,提出一种融合电流预测与功率预测的双模式MPC控制方法,旨在提升逆变器在复杂电网环境下的动态响应性能、控制精度与系统稳定性。通过Simulink搭建三相并网逆变器仿真模型,结合Matlab实现控制算法编程,对系统在不同工况下的并网电流跟踪能力、有功与无功功率解耦控制效果以及抗电网扰动性能进行了全面仿真验证。研究重点包括预测模型构建、代价函数设计、多模式切换逻辑优化及闭环控制系统集成,有效解决了传统控制策略存在的延迟大、耦合性强、鲁棒性不足等问题。; 适合人群:具备电力电子、自动控制理论基础,从事新能源发电、微电网或电力系统自动化相关研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①用于提升三相并网逆变器在电网波动、负载突变等非理想条件下的运行性能;②为模型预测控制在电力电子系统中的应用提供仿真与代码实现参考;③服务于高校科研项目、硕士/博士论文复现及工程项目原型开发。; 阅读建议:建议结合Simulink仿真模型与Matlab代码同步学习,重点关注预测控制算法的设计细节与参数整定过程,宜在掌握基本MPC原理基础上深入理解双模式切换机制及其对系统性能的优化作用。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值