【CVPR 2025】UNEM:展开广义EM,让少样本推理超参数自动学习|从少样本学习算法设计视角

摘要

本文解读 CVPR 2025 论文《UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning》。该论文提出 UNEM(Unrolled Generalized EM),通过把广义期望最大化算法的每次迭代展开成网络层、并将类别平衡与温度超参数变成可学习参数,让转导少样本推理彻底告别网格搜索。其特别之处在于仅用 21 个参数、数秒训练 就同时覆盖高斯与 Dirichlet 两种分布、纯视觉与 CLIP 两类范式。实验表明纯视觉最高提升 10 个百分点,CLIP 11 个数据集平均提升 4.2 个百分点,为少样本学习提供了"超参数也可以被学习"的全新设计范式。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning
标题(中文)UNEM:展开广义EM,让少样本推理超参数自动学习
作者Long Zhou, Fereshteh Shakeri, Aymen Sadraoui, Mounir Kaaniche, Jean-Christophe Pesquet, Ismail Ben Ayed
机构Politecnico di Milano · ÉTS Montréal · Université Paris-Saclay / Inria / CentraleSupélec · Sorbonne Paris Nord
会议CVPR 2025
arXivhttps://arxiv.org/abs/2412.16739
项目网站https://github.com/ZhouLong0/UNEM-Transductive

背景与动机

转导(transductive)少样本推理是当前少样本分类的最强范式:它不逐样本独立预测,而是把整个查询批(query set)放在一起联合推理,利用无标注样本的统计信息。从 TIM(NeurIPS 2020)的信息最大化、LaplacianShot(ICML 2020)的图正则化,到 PADDLE(NeurIPS 2022)的 MDL 聚类、EM-Dirichlet(CVPR 2024)首次把转导带入 CLIP,这条主线持续刷新精度纪录。

但这类方法普遍依赖一个"隐藏的魔鬼":类别平衡超参数 $\lambda$。$\lambda$ 控制目标函数对类分布的先验强度,它的最优取值可能随数据集相差数量级——论文用 EM-Dirichlet 在 10 个 CLIP 数据集上实测,最优 $\lambda$ 从几十到上万不等。现有做法是在验证集上网格搜索,既次优又不可扩展;加上温度 $T$ 等额外超参数后,搜索空间进一步爆炸。更糟的是,多数方法假设查询集类别均衡,而真实场景(如细粒度分类)并不满足。

UNEM 的回答是:把超参数选择从"搜索"重构为"学习"。借助信号处理领域成熟的 unrolling(learning to optimize)范式——LISTA、ISTA-Net、Monga 等人的综述(IEEE SPM 2021)——把迭代优化器映射成神经网络,让验证任务上的交叉熵直接反传优化这些超参数。

研究主线:从问题到结论

UNEM 研究主线流程图:问题→动机→设计→方法→实验→结论

图 5:UNEM 研究主线(Mermaid 流程图)——从"调参难"问题出发,经 GEM 统一框架与迭代展开设计,到纯视觉 + CLIP 双范式实验验证,最终以 21 参数 + 4.2pt 平均增益收束。

基准/方法设计

UNEM 的出发点是广义 EM(GEM)目标函数:

$\min_{u,\theta}\; \mathcal{L}(u,\theta) + \lambda\Psi(u) + T\Phi(u)$

三项分别对应:负对数似然(数据拟合)、类别分布香农熵($\lambda$ 控制类别平衡强度)、分配熵势垒($T$ 控制分配软度)。每次迭代三步更新:分布参数 $\theta_k \leftarrow \mathrm{DP_est}$、类别占比 $\pi_k \leftarrow \frac{1}{|Q|}\sum u_{n,k}$、分配向量 $u_n \leftarrow \mathrm{softmax}(\frac{1}{T}(\ln p(z_n|\theta_k) + \frac{\lambda}{|Q|}\ln\pi_k))$。这个框架的优雅之处在于特例统一:$T{=}1$、$\lambda{=}|Q|$ 时退化为经典 EM,$T{=}1$ 且用 Dirichlet 分布时恢复为 EM-Dirichlet——GEM 是它们的公共泛化。

UNEM 动机图:类别平衡超参数 λ 对精度的关键影响

图 1:类别平衡超参数 λ 对精度的关键影响。同一 EM-Dirichlet 算法在 10 个 CLIP 数据集上,最优 λ(星标)相差数量级,验证了手工调参不可行的动机。

分类全景

转导少样本方法按技术路线可分为四大流派,UNEM 用统一优化视角把它们收进同一框架:

转导少样本方法分类全景:聚类、信息最大化、标签传播、最优传输与统一框架

图 6:转导少样本方法分类全景(Mermaid 流程图)——聚类派(PADDLE、α-AM)、信息最大化派(TIM、α-TIM)、标签传播派(TPN、ProtoLP)、最优传输派(ILPC),以及统一它们的 GEM→UNEM 框架。

方法细节

展开为网络:$L$ 次迭代 = $L$ 层网络,每层学习独立的超参数 $(\lambda^{(\ell)}, T^{(\ell)})$,实现逐层自适应——这是 unrolling 相对传统迭代算法的核心红利。

约束建模:$\lambda = \mathrm{Softplus}(a) \ge 0$ 保证非负;$T = 1 + \mathrm{Softplus}(b) \ge 1$,下界 1 防止训练时温度趋近零导致梯度消失。

训练方式:在验证任务上最小化交叉熵 $\mathcal{L}c = \sum y{n,k}\log u_{n,k}^{(L)}$,全网络仅 $2L$ 个参数($L{=}10$ 时共 21 个)。纯视觉用 1000 个验证任务、CLIP 用 100 个,80 epoch、Adam。

两种实例:UNEM-Gaussian(高斯分布 + 特征缩放 $T_z$,面向纯视觉骨干)与 UNEM-Dirichlet(Dirichlet 分布,面向 CLIP 的类别概率型特征)。

UNEM 单层结构:GEM 每次迭代对应一层网络

图 2:GEM 单次迭代展开为网络层。每个迭代 ℓ 对应一层,层内执行 θ、π、u 三个更新块,并携带该层专属超参数 (λ, T)。

UNEM 总体架构:L 个级联层各自带可学习超参数

图 3:UNEM 总体架构。特征 z 馈入所有层,L 个级联层各自携带可学习 (λ, T),输出第 L 层类别分配,以交叉熵在验证任务上训练。

实验设计与结果

评测协议:转导设置下支撑集含 $K$ 类、查询集仅含 $K_{\mathrm{eff}}$ 个真实类别(类不平衡、不披露);纯视觉 5/10/20-shot,CLIP 4-shot;精度在 1000 个任务上取平均。骨干:纯视觉 ResNet-18 / WRN28-10(微调),CLIP 直接用预训练模型。

主表:mini-ImageNet / tiered-ImageNet(ResNet-18,K=20/160)

方法mini 5-shotmini 20-shottiered 5-shottiered 20-shot
Baseline55.467.929.742.2
LaplacianShot57.968.329.639.1
TIM66.870.829.327.8
α-TIM66.773.943.851.9
PADDLE62.979.845.470.6
UNEM-Gaussian66.480.452.373.2

UNEM-Gaussian 全面超越 PADDLE 与 SOTA:tiered 5-shot 提升 6.9pt(52.3 vs 45.4)。换 WRN28-10 骨干后优势更大(mini 20-shot 83.7、tiered 20-shot 74.7,5-shot 最高 +10pt);CUB 上 5-shot 78.5 vs PADDLE 71.2(+7.3pt)。关键佐证:PADDLE 换骨干几乎不涨——固定 $\lambda{=}|Q|$ 远离最优,印证超参数必须"学"而非"猜"。

CLIP 11 数据集(4-shot,平均精度)

方法Food101OxfordPetsFlowers102SUN397ImageNet平均
Tip-Adapter76.786.483.266.762.768.3
CoOp76.386.281.063.459.965.5
LaplacianShot76.688.485.563.856.364.8
PADDLE71.884.782.360.652.160.9
EM-Dirichlet88.792.591.380.978.473.6
UNEM-Dirichlet91.496.095.688.583.177.8

UNEM-Dirichlet 平均 77.8 vs EM-Dirichlet 73.6(+4.2pt),大类数数据集收益最大:FGVC Aircraft +5.5pt、Stanford Cars +6.5pt、SUN397 +7.6pt。

UNEM-Dirichlet 学到的超参数组合(λ, T)

图 4:UNEM-Dirichlet 学到的超参数 (λ, T)。不同数据集收敛到截然不同的 λ 区域(从百量级到近万),直接说明单一经验值不可行。

附录消融:温度缩放带来 1–3pt 提升(tiered 5-shot +2.6pt、EuroSAT +2.9pt);逐层自适应超参比固定超参高 2–4pt(mini 5-shot +3.9pt);层数消融显示 L=7–10 即饱和(10 层 21 参数、训练 3.61s、推理 0.034s/任务);分布偏移场景(tiered 预训练 → CUB/mini 推理)UNEM 仍提升 6.9pt 与 4.1pt;换 CLIP ViT-B/32 骨干增益一致(SUN397 +6.7pt)。

结果对比总结

UNEM 结果对比总结:PADDLE 与 EM-Dirichlet 基线的增益汇总

图 7:结果对比总结(Mermaid 流程图)——UNEM-Gaussian 在 tiered 5-shot 相对 PADDLE +6.9pt,UNEM-Dirichlet 在 CLIP 11 数据集平均相对 EM-Dirichlet +4.2pt。

关键发现

  1. 超参数敏感度惊人:同一算法的最优 $\lambda$ 在 10 个 CLIP 数据集间相差数量级(几十到上万),网格搜索本质上不可行。
  2. 极简参数预算:L=10 的 UNEM 全部可学习参数仅 21 个,训练 3.61 秒,推理 0.034 秒/任务,却替代了昂贵搜索。
  3. 纯视觉最高 +10pt:WRN28-10 骨干 5-shot 场景相对 PADDLE 提升 10 个百分点,tiered-ImageNet 全面刷新 SOTA(52.3/65.7/73.2)。
  4. CLIP 平均 +4.2pt:UNEM-Dirichlet 在 11 个数据集平均 77.8,类别数越多收益越大(SUN397 +7.6pt、Stanford Cars +6.5pt)。
  5. 逐层自适应是核心红利:自适应超参比固定超参高 2–4pt;温度缩放再贡献 1–3pt。
  6. 跨骨干、跨域稳健:ViT-B/32 骨干增益一致;分布偏移场景(tiered→CUB)仍提升 6.9pt。

局限性

  • 仍需验证任务训练:每个数据集/骨干要重新学习超参数(好在只需数秒与 21 个参数)。
  • 分布模型有限:仅验证高斯与 Dirichlet 两种指数族分布,类别数最大到 $K{=}160$。
  • 转导假设:依赖查询批共享类别结构,极端分布偏移下收益取决于 $\lambda$ 的泛化。
  • 机制分析初步:学到的 $(\lambda^{(\ell)}, T^{(\ell)})$ 逐层演化规律尚未深入解释。

常见问题(FAQ)

UNEM 与传统 EM 算法是什么关系?

UNEM 是 EM 的广义化展开版本。当 $T{=}1$、$\lambda{=}|Q|$ 时 GEM 退化为经典 EM;当 $T{=}1$ 且采用 Dirichlet 分布时恢复为 EM-Dirichlet(CVPR 2024)。UNEM 把这些迭代展开成 10 层网络,让超参数可学习。

为什么超参数不能用网格搜索解决?

论文实测最优 $\lambda$ 跨数据集相差数量级,且随骨干变化。网格搜索在验证集上枚举候选值,既无法覆盖连续空间,又为每个数据集重复计算,成本随超参数数量指数增长。

21 个参数的网络如何训练?

把 10 次 GEM 迭代映射为 10 层,每层只有 $(\lambda^{(\ell)}, T^{(\ell)})$ 两个可学习标量(Softplus 约束),在验证任务的交叉熵损失下用 Adam 端到端反传,80 epoch 即可收敛。

UNEM-Gaussian 和 UNEM-Dirichlet 有什么区别?

前者假设特征服从高斯分布(均值原型、闭式更新),面向纯视觉骨干(ResNet/WRN);后者假设 CLIP 的类别概率型特征服从 Dirichlet 分布(MM 更新),面向视觉语言模型。架构与训练流程完全一致。

代码开源了吗?

是的,官方实现与学习到的超参数已开源在 https://github.com/ZhouLong0/UNEM-Transductive。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2412.16739
  • 官方代码(UNEM-Transductive):https://github.com/ZhouLong0/UNEM-Transductive
  • PADDLE(NeurIPS 2022):https://arxiv.org/abs/2207.14214
  • EM-Dirichlet / Transductive Zero-Shot and Few-Shot CLIP(CVPR 2024):https://arxiv.org/abs/2406.10064
  • Algorithm Unrolling 综述(IEEE SPM 2021):https://arxiv.org/abs/1912.10557

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

内容概要:本文围绕基于Transformer模型的电力负荷预测展开研究,提出了一种利用Transformer架构进行负荷预测的方法,并提供了完整的Python代码实现。文章详细阐述了Transformer在处理时间序列数据方面的独特优势,如强大的长期依赖捕捉能力和高效的并行化训练机制,相较于传统的RNN或LSTM模型在预测精度、收敛速度和稳定性方面表现更优。研究涵盖了从原始数据预处理、特征工程构建、模型结构设计到训练优化及预测结果评估的全流程,重点剖析了编码器-解码器结构、自注意力机制、位置编码等核心技术在负荷预测任务中的具体应用与实现细节,并通过真实电力负荷数据集验证了该方法在短期和中期负荷预测场景下的有效性和鲁棒性。; 适合人群:具备一定Python编程基础和机器学习、深度学习理论知识,从事电力系统分析、能源管理、智能电网、时序预测等相关领域的科研人员及工程技术人员,特别适合工作1-3年、希望深入掌握先进深度学习模型在能源领域实际应用的研发人员。; 使用场景及目标:①应用于电力系统短期或中期负荷预测任务,辅助电网调度、发电计划制定和能源市场交易,提升电力系统运行的智能化与精细化水平;②为研究者和开发者提供一个基于Transformer的时间序列预测完整实践范例,帮助深入理解其建模范式、关键组件的设计原理及超参数调优策略;③推动深度学习特别是注意力机制在电力负荷预测及其他能源时序数据分析中的创新应用与技术迭代。; 阅读建议:建议读者结合所提供的Python代码逐模块复现整个建模流程,重点关注输入序列的滑动窗口构造、位置编码的实现方式、多头注意力机制的计算过程以及损失函数的选择,同时鼓励在不同地区、不同季节的负荷数据集上进行迁移实验,以全面评估模型泛化能力,并尝试引入外部变量(如天气、节假日)进一步优化预测性能。
内容概要:本文围绕“计及电气热综合需求响应的区域综合能源系统优化调度”展开研究,提供了完整的Matlab代码实现方案,旨在通过模型复现帮助科研人员深入掌握综合能源系统的优化调度方法。研究聚焦于电力、燃气、热力等多种能源形式的协同优化,充分考虑用户侧的需求响应机制,构建了包含多种能源转换设备、储能装置及多类型负荷的区域综合能源系统模型。以系统运行经济性、能源利用效率和碳排放最小化为多重优化目标,建立了精细化的数学模型,并采用Matlab进行编程求解,实现了在不同场景下的优化调度仿真与性能对比分析,为提升系统综合效益、促进清洁能源消纳及实现低碳化运行提供了有效的技术路径与决策支持。; 适合人群:具备电力系统、能源系统、优化理论或运筹学等相关基础知识,从事综合能源系统、微电网、需求响应、低碳调度等方向研究的研究生、高校科研人员及能源领域的工程技术人员。; 使用场景及目标:① 学习和复现区域综合能源系统优化调度的经典建模思路与算法实现过程;② 掌握Matlab在多能流耦合系统建模、求解器调用与结果可视化方面的综合应用能力;③ 支持开展电气热综合需求响应相关的科研项目、论文撰写与工程实践;④ 为构建更复杂的多区域协同、不确定性优化或博弈调度模型提供可靠的代码基础与技术参考。; 阅读建议:此资源以Matlab代码为核心载体,结合详细的模型说明与结果分析,建议读者按照文档目录结构逐步研读,结合代码注释理解变量定义、约束构建与目标函数设定的逻辑,重点关注需求响应建模与多能耦合环节的实现方式,并可通过调整负荷参数、设备配置或优化目标等方式拓展模型,以适应自身的研究需求,同时可利用提供的网盘链接下载完整资源进行深入学习与验证。
内容概要:本文系统阐述了基于遗传算法优化长短记忆网络(GA-LSTM)的电力系统负荷预测方法,该模型通过遗传算法(GA)对LSTM的关键超参数进行全局寻优,有效克服了传统LSTM依赖经验调参的局限性,显著提升了预测的精度与鲁棒性。研究内容涵盖了完整的数据预处理流程、GA-LSTM混合模型的架构设计、遗传算法的优化机制以及详细的实验验证过程,并利用Matlab代码实现了整个算法流程。文中通过对比实验验证了GA-LSTM模型相较于单一LSTM及其他传统预测模型在预测准确性上的优越性能。; 适合人群:具备一定电力系统基础知识和Matlab编程能力,从事科研或工程应用的研发人员、研究生及高年级本科生。; 使用场景及目标:①应用于电力系统短期或中期负荷预测,为电网调度、发电计划制定提供科学依据,提高电网运行的经济性与安全性;②为新能源并网、电力市场运营、需求侧管理等业务提供精准的负荷数据支持;③学习并掌握智能优化算法(如遗传算法)与深度学习模型(如LSTM)融合的技术路径与实现方法,拓展在时序预测领域的研究与应用能力。; 阅读建议:读者应结合提供的Matlab代码进行实践操作,重点关注遗传算法优化LSTM超参数的具体实现过程、模型训练细节及性能评估指标的分析,建议在深刻理解模型原理的基础上,尝试调整算法参数或将其迁移应用于其他时间序列预测问题,以深化理解和掌握。
内容概要:本文围绕基于电流-功率双模式模型预测控制(MPC)的三相并网逆变器闭环控制策略展开研究,提出一种融合电流预测与功率预测的双模式MPC控制方法,旨在提升逆变器在复杂电网环境下的动态响应性能、控制精度与系统稳定性。通过Simulink搭建三相并网逆变器仿真模型,结合Matlab实现控制算法编程,对系统在不同工况下的并网电流跟踪能力、有功与无功功率解耦控制效果以及抗电网扰动性能进行了全面仿真验证。研究重点包括预测模型构建、代价函数设计、多模式切换逻辑优化及闭环控制系统集成,有效解决了传统控制策略存在的延迟大、耦合性强、鲁棒性不足等问题。; 适合人群:具备电力电子、自动控制理论基础,从事新能源发电、微电网或电力系统自动化相关研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①用于提升三相并网逆变器在电网波动、负载突变等非理想条件下的运行性能;②为模型预测控制在电力电子系统中的应用提供仿真与代码实现参考;③服务于高校科研项目、硕士/博士论文复现及工程项目原型开发。; 阅读建议:建议结合Simulink仿真模型与Matlab代码同步学习,重点关注预测控制算法设计细节与参数整定过程,宜在掌握基本MPC原理基础上深入理解双模式切换机制及其对系统性能的优化作用。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值