摘要
本文解读 CVPR 2025 论文《MMRL: Multi-Modal Representation Learning for Vision-Language Models》。该论文提出多模态表示学习(MMRL)框架,通过融合共享可学习表示空间、表示 token 高层注入与类 token 余弦正则,在少样本(16-shot)条件下既提升任务适配精度又保住预训练泛化能力,其特别之处在于训练与推理的解耦策略:表示 token 学任务、类 token 保泛化。实验表明11 个数据集 base-to-novel 调和平均达到 81.20,基类精度 85.68,全面刷新 SOTA,且 ImageNet 16-shot 训练仅需 3.6 分钟,为视觉语言模型的高效迁移学习提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | MMRL: Multi-Modal Representation Learning for Vision-Language Models |
| 标题(中文) | 多模态表示学习:让 CLIP 少样本适配不再过拟合 |
| 作者 | Yuncheng Guo, Xiaodong Gu |
| 机构 | 复旦大学电子工程系 |
| 会议 | CVPR 2025 |
| arXiv | https://arxiv.org/abs/2503.08497 |
| 项目网站 | https://github.com/yunncheng/MMRL |
背景与动机:为什么 CLIP 少样本适配会过拟合?
大规模预训练的视觉语言模型(VLM)如 CLIP,用 4 亿图文对做对比学习,具备强大的零样本能力。但把它迁移到下游任务时,训练数据往往很少(每类仅 16 张图),于是出现一对矛盾:适配得越用力,过拟合越严重,零样本泛化损失越大。
现有适配路线主要有两条,都有共同的隐含假设——只优化类 token 特征:
- 提示学习:CoOp(IJCV 2022)把手工模板换成可学习连续向量;CoCoOp(CVPR 2022)用视觉线索生成实例级提示;MaPLe(CVPR 2023)在多个层同时加图文提示;PromptSRC(ICCV 2023)加自正则约束。问题:深层提示从文本侧映射视觉,本质仍是文本中心,少样本下基类涨点但新类掉得厉害(CoOp 的 Novel 精度从零样本 74.22 掉到 63.22)。
- 适配器风格:CLIP-Adapter、Tip-Adapter 在输出端加轻量 MLP;MMA(CVPR 2024)把跨分支特征聚合到共享空间,允许梯度跨模态流动。问题:只在输出端做特征聚合,编码器内部没有真正的跨模态交互。
从历史视角看,这条技术线从 CLIP(2021)确立零样本基线,到 CoOp/CoCoOp(2022)开创提示学习,再到 MaPLe/PromptSRC/TCP(2023–2024)走向深层多模态提示与共享特征空间,始终没有跳出"改输入提示"或"改输出特征"的框架。MMRL 的答案是:在编码器内部建一个共享可学习表示空间,让双模态在深层语义层真正交互。
研究主线:从问题到结论

图 5:MMRL 研究主线流程图(Mermaid)——问题、动机、设计、方法、实验、结论
基准/方法设计:一个空间,两个模态
MMRL 维护一个共享、可学习、模态无关的表示空间 $\mathcal{R}$:里面放 $K$ 个高斯初始化的空间 token(默认 $K=5$,维度 $d_r=512$),通过两个线性映射函数 $\mathcal{F}$ 分别投影成图像表示 token 和文本表示 token。从第 $J=6$ 个 Transformer 层开始,这些 token 被拼进冻结的 CLIP 编码器序列——低层保持纯净以保留通用视觉/文本知识,高层注入任务特定表示。
训练时只优化三部分:表示空间 $\mathcal{R}$、映射函数 $\mathcal{F}$、表示 token 的 patch 投影层;整个预训练 CLIP 完全冻结。文本编码器是自回归结构,因此还要调整注意力掩码以容纳更长的 token 序列。

图 1:MMRL 训练框架:共享表示空间经线性映射注入图文编码器高层(C 类 token,B/EOT 文本边界,R 表示 token)
分类全景:VLM 高效适配的三条路线

图 6:VLM 高效适配三路线分类图(Mermaid)——提示学习 / 适配器 / 表示学习
方法细节:解耦训练与推理
MMRL 的核心是解耦策略,让"学任务"和"保泛化"各司其职:
- 训练阶段:表示特征走可训练投影层,类特征走冻结投影层,分别计算交叉熵损失 $\mathcal{L}_c$ 与 $\mathcal{L}_r$;同时用余弦正则把类特征 $(f_c, w)$ 拉向冻结 CLIP 特征 $(f_0, w_0)$。总损失为 $\mathcal{L} = \alpha \mathcal{L}_c + (1-\alpha) \mathcal{L}_r + \lambda(\mathcal{L}_v + \mathcal{L}_t)$,默认 $\alpha=0.7$,ImageNet 上 $\lambda=0.5$。
- 基类推理:训练见过的类别,融合两种特征 $p(y|x) = \alpha p(y|f_c) + (1-\alpha) p(y|f_r)$——任务特定知识与通用知识互补。
- 新类推理:未见过的类别,只用类特征 $p(y|f_c)$——因为表示 token 学的是数据集特定分布,直接用于新类会过拟合。

图 2:MMRL 推理过程:不同任务使用不同特征(base 类融合、novel 类仅类特征)
实现细节:ViT-B/16 骨干,AdamW 优化器(学习率 $10^{-3}$),混合精度训练;ImageNet 上 batch size 32、5 个 epoch,其余数据集 batch size 4、10 个 epoch;三次运行取平均,全部实验单张 RTX 4090 完成。
实验设计与结果:四项评测全部 SOTA
实验覆盖四类评测,默认 16-shot:base-to-novel(11 个数据集类别对半切分)、跨数据集(ImageNet 1000 类训练后直接用到其余 10 个数据集)、域泛化(ImageNet → V2/Sketch/A/R)、少样本(每类 1/2/4/8/16 shot)。
base-to-novel 平均结果(主表):
| 方法 | Base | Novel | HM |
|---|---|---|---|
| CLIP(零样本) | 69.34 | 74.22 | 71.70 |
| CoOp | 82.69 | 63.22 | 71.66 |
| MaPLe | 82.28 | 75.14 | 78.55 |
| PromptSRC | 84.26 | 76.10 | 79.97 |
| MMA | 83.20 | 76.80 | 79.87 |
| MMRL(本文) | 85.68 | 77.16 | 81.20 |
MMRL 在平均 Base(+2.48pp)、Novel(+0.36pp)、HM(+1.33pp)三项全面超过上一 SOTA MMA,11 个数据集的调和平均全部最佳——雷达图完整包裹所有基线。值得注意的是 CoOp 基类 82.69 但新类只有 63.22,说明只优化类 token 的提示方法过拟合严重;MMRL 在两者间取得最佳平衡。

图 3:少样本学习对比:MMRL 在全部 shot 设置(1/2/4/8/16)下平均精度最高,且随 shot 数增多优势扩大
- 跨数据集:ImageNet 源域 72.03(+1.03pp 超 MMA),10 个目标数据集平均 67.25 为最高。
- 域泛化:ImageNet-V2 64.47、ImageNet-A 51.20 两个偏移集取得最佳。
- 少样本:全部 shot 设置平均精度最高,且 shot 数越多优势越大。

图 4:消融实验:左——表示 token 注入层位置 J;右——表示 token 数量 K
附录消融细节(全部在 11 数据集 base-to-novel 上平均):注入层 $J=6$ 最优——过低(如第 2 层)基类精度明显下降,说明低层特征不可适配;过高则可学习参数减少、容量不足。token 数 $K=5$ 最优,过多导致新类精度回落。表示维度 $d_r=512$ 最优(EuroSAT 用 2048),继续增大出现过拟合。$\alpha$ 扫描 0.0→1.0 中 0.7 最优(HM 81.20,两端分别掉到 77.29 和 79.42);$\lambda$ 在 ImageNet 上 0.5 最优(HM 74.45)。正则策略对比中余弦正则(81.20)显著优于 L1(80.47)与 MSE(79.53),因为余弦约束更松弛,类 token 保泛化的同时仍能捕捉任务知识。
附录 A 计算开销(ImageNet 16-shot,单张 RTX 4090):
| 方法 | 可训练参数 | 训练(ms/图) | FPS | HM |
|---|---|---|---|---|
| MaPLe | 3.555M | 39.5 | 1757.6 | 78.55 |
| PromptSRC | 0.046M | 40.0 | 1764.2 | 79.97 |
| ProVP | 0.147M | 4.4 | 928.9 | 78.76 |
| TCP | 0.332M | 5.3 | 950.6 | 79.51 |
| MMA | 0.675M | 2.2 | 688.5 | 79.87 |
| MMRL | 4.992M | 5.3 | 762.4 | 81.20 |
| MMRL*($d_r=32$) | 0.689M | 5.3 | 767.8 | 80.84 |
MMRL 整轮 ImageNet 16-shot 训练仅 3.6 分钟;把 $d_r$ 压到 32 后参数与 MMA 持平(0.689M),HM 仍有 80.84,说明成本可按需压缩。
结果对比总结

图 7:结果对比总结图(Mermaid)——CLIP 71.70 → CoOp 71.66 → MMA 79.87 → MMRL 81.20
关键发现
- 解耦策略是收益核心:去掉解耦(只用类特征,w/o DS₁)基类精度从 85.68 掉到 83.59;只用表示特征($\alpha=0$)HM 掉到 77.29。
- 双模态交互不可或缺:仅图像侧(w/o L)HM 80.08、仅文本侧(w/o V)HM 78.74,都比双模态联合的 81.20 低——共享空间必须同时服务两个编码器。
- 效率与性能可兼得:4.99M 参数、5.3 ms/图训练、762 FPS 推理,HM 81.20;压缩到 0.689M 参数仍有 80.84,优于同规模的 MMA(79.87)。
- 少样本优势随数据扩大:1-shot 平均 72.67、16-shot 平均 85.08 附近的全 shot 最佳表现,说明表示学习能有效利用每一张新增样本。
- 跨域迁移稳健:ImageNet 训练直接迁移到 10 个目标数据集平均 67.25,域泛化 4 个偏移集拿下 2 个第一。
局限性
- 实验只在 CLIP ViT-B/16 一个骨干上验证,未覆盖更大模型或其他 VLM(如 SigLIP、EVA-CLIP)。
- 可训练参数 4.99M 明显高于 MMA 的 0.675M;压缩到 $d_r=32$ 虽有缓解,仍非零成本。
- 表示维度、注入层、$\alpha$、$\lambda$ 等超参数需要按数据集微调(如 EuroSAT 用 $d_r=2048$)。
- Novel 精度并非每个数据集都最高:FGVCAircraft 上落后 PromptSRC 0.84pp(但基类高 3.57pp)。
- 作者展望更参数高效的表示学习与模态内交互,即后续工作 MMRL++(IJCV 2026)。
常见问题(FAQ)
MMRL 和 MMA 有什么区别?
MMA 在输出端把跨分支特征聚合进共享空间,本质是特征融合;MMRL 在编码器内部(第 6 层起)注入可学习的表示 token,让图文双模态在深层 Transformer 中真正交互,并且用解耦策略分开优化表示特征与类特征。
为什么表示 token 只注入高层编码器?
低层编码器保存的是通用、可迁移的视觉/文本知识,注入任务特定 token 会破坏它们;高层特征本身偏数据集特定、可塑性强。消融显示注入层太低时基类精度明显下降,第 6 层是最佳折中。
解耦策略在推理时如何工作?
对训练见过的基类,融合类特征与表示特征的概率($\alpha=0.7$ 加权);对未见的新类,只用类特征。因为表示 token 学的是数据集特定分布,直接用于新类会过拟合,而类特征被余弦正则约束在预训练特征附近,保留了零样本能力。
MMRL 需要多少训练资源?
单张 RTX 4090 即可完成全部实验。ImageNet 16-shot 整轮训练约 3.6 分钟,每张图训练 5.3 毫秒;推理 762 FPS。
MMRL 的代码开源了吗?
开源了。官方实现位于 github.com/yunncheng/MMRL,并包含延伸工作 MMRL++。
MMRL 的主要局限是什么?
骨干单一(仅 CLIP ViT-B/16)、可训练参数偏高(4.99M vs MMA 0.675M)、超参数需按数据集调,以及新类精度并非处处最高。
参考链接
- arXiv 摘要页:https://arxiv.org/abs/2503.08497
- 官方代码(含 MMRL++):https://github.com/yunncheng/MMRL
- CLIP(ICML 2021):https://arxiv.org/abs/2103.00020
- CoOp(IJCV 2022):https://arxiv.org/abs/2109.01134
- MaPLe(CVPR 2023):https://arxiv.org/abs/2210.03117
- MMA(CVPR 2024):https://arxiv.org/abs/2405.16904
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)


被折叠的 条评论
为什么被折叠?



