1. 项目背景与核心突破
细粒度视觉识别一直是计算机视觉领域的硬骨头。传统方法需要海量标注数据才能区分"麻雀"和"知更鸟"这种高度相似的子类别,而北大团队在ICLR 2026提出的新模型,仅需每类4张训练图像就能达到超越CLIP的识别精度。这个突破性进展主要来自三个创新:
-
动态原型学习框架:模型在推理时会根据输入图像动态生成类别原型,而非依赖固定特征。这就像经验丰富的鸟类学家,看到羽毛纹理就能在脑中构建临时比对样本。
-
跨模态知识蒸馏:通过文本描述自动生成视觉注意力热图。比如当文本出现"喙部弯曲"时,模型会重点强化相关区域的特征提取。
-
增量式参数更新:95%的模型参数在预训练后冻结,仅微调关键适配层。实测显示,新增类别只需训练约0.3M参数,是CLIP微调参数的1/500。
关键发现:在Food-101细粒度数据集测试中,使用4样本/类时,新模型达到82.3%准确率,比CLIP零样本高19.7个点,甚至超过CLIP用全量数据微调的结果(79.1%)
2. 技术架构深度解析
2.1 动态原型生成网络
模型核心是一个可微分的内存模块,工作原理类似人脑的"工作记忆":
class DynamicPrototype(nn.Module):
def __init__(self, feat_dim=768):
super().__init__()
self.memory = nn.Parameter(torch.randn(100, feat_dim)) # 可训练记忆槽
self.attention = nn.Sequential(
nn.Linear(feat_dim, 256),
nn.GELU(),
nn.Linear(256, 100)




697

被折叠的 条评论
为什么被折叠?



