论文题目:RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly Detection(RealNet:一种具有真实合成异常的特征选择网络,用于异常检测)
会议:CVPR2024
摘要:自监督特征重建方法在工业图像异常检测和定位方面显示出良好的发展前景。尽管取得了这些进展,但这些方法在合成真实多样的异常样本、解决特征冗余和预训练特征的预训练偏差等方面仍然面临挑战。本文介绍了一种具有真实合成异常和自适应特征选择功能的特征重构网络RealNet。它包含三个关键创新:首先,我们提出了强度可控扩散异常合成(SDAS),这是一种基于扩散过程的合成策略,能够生成具有不同异常强度的样本,模拟真实异常样本的分布。其次,我们开发了异常感知特征选择(AFS),一种选择具有代表性和判别性的预训练特征子集的方法,以提高异常检测性能,同时控制计算成本。第三,我们引入了重建残差选择(RRS),这是一种自适应选择判别残差的策略,用于跨多个粒度级别的异常区域的综合识别。我们在四个基准数据集上对RealNet进行了评估,结果表明,与当前最先进的方法相比,RealNet在图像AUROC和像素AUROC方面都有了显著的改进。
代码、数据和模型可在https://github.com/cnulab/RealNet上获得。
RealNet:用扩散模型合成真实异常,重新定义工业图像异常检测
一、背景与问题:现有方法的三重困境
工业图像异常检测是制造业质量控制的核心任务。近年来,基于自监督学习的方法逐渐成为主流——它们只用正常图像训练模型,通过合成异常样本来学习"什么是异常"。然而,这一范式在实际落地中面临三个根本性挑战。
困境一:合成异常与真实异常的分布鸿沟
现有主流合成方法大致分为两类:
- 手工增强策略:如 CutPaste(随机裁剪粘贴图像块)、NSA(基于泊松图像编辑的无缝粘贴)
- 外部纹理数据:如 DRAEM(利用 DTD 纹理数据集合成纹理类异常)
这些方法的共同缺陷在于,它们受限于数据增强规则或外部数据的分布,难以模拟真实世界中复杂的结构性异常(如零件部分缺失、错位等),更无法生成模型从未见过的异常类别。合成样本与真实异常之间存在显著的分布差距,严重制约了模型的泛化能力。

【此处配图:Figure 3(b)——对比 Original / SDAS(s=0) / SDAS(s=0.1) / SDAS(s=0.2) / DTD / CutPaste / NSA 六种方法生成的局部异常区域对比图】
困境二:预训练特征的冗余性与偏差
基于特征重建的方法(如 RD、UniAD)利用 ImageNet 预训练大型 CNN 提取的多尺度特征进行异常检测,具有强大的判别能力。然而:
- 特征冗余:高维预训练特征包含大量与异常检测无关的冗余通道
- 预训练偏差:模型在 ImageNet 分类任务上训练,其特征空间并非为异常检测优化
现有解决方案或使用小型网络(受限判别能力),或手动指定特定层的特征(缺乏灵活性,对不同类别次优)。研究表明,最优特征子集因产品类别不同而存在显著差异,统一的手动选择策略不可避免地导致性能下降。
困境三:重建残差中的"噪声"干扰
在多尺度特征重建后,不同粒度的残差图对异常检测的贡献差异巨大。将所有残差直接融合用于异常评分时,大量不含异常信息的残差会引入干扰,掩盖真实的异常信号,造成大量漏检。
二、RealNet 的整体架构
针对上述三个困境,论文提出了 RealNet,一个由三个核心模块协同构成的特征重建异常检测框架。

整体流程如下:
- SDAS 利用扩散模型,仅从正常图像出发生成多样化的异常图像,构建训练用的合成异常数据集 SIA
- AFS 对大型预训练 CNN 各层特征进行自监督评估与筛选,保留最具判别力的特征子集,并训练重建网络将异常特征映射回正常特征
- RRS 从重建残差中自适应选取最含异常信息的子集,送入判别器生成最终异常评分
三、创新点一:强度可控扩散异常合成(SDAS)
核心思路
SDAS 基于去噪扩散概率模型(DDPM)。其关键洞察在于:正常图像对应概率密度空间的高概率区域,而异常图像位于其附近的低概率密度区域。
训练阶段,DDPM 学习正常图像的分布 q(x_0),其训练目标为:
![]()
异常合成机制
在标准 DDPM 反向扩散过程中,每一步从正态分布
中采样。SDAS 的创新在于,向这一过程引入额外的扰动项,使采样方差扩大:
![]()
其中标量
控制异常强度:
- s = 0:采样结果为正常图像
- s 越大:偏离正常分布越远,异常越明显
最终,将 SDAS 生成的异常图像 P 与正常图像 I 通过 Perlin 噪声遮罩 M 进行混合,得到带有局部异常区域的训练样本:
![]()
SDAS 的优势
相比 DTD、CutPaste、NSA:
- 不依赖外部数据集或手工增强规则
- 直接在概率空间操作,生成的异常更自然连续
- 支持强度调控,可合成从微弱到明显的全范围异常
- 能够模拟老化、结构形变、纹理异常、颜色变化等多种真实异常模式

【此处配图:Figure 1——SDAS 仅用正常图像生成异常图像的示例,包含 MVTec-AD 中多个类别的对比展示】

合成工业异常数据集(SIA)
基于 SDAS,论文构建了 SIA(Synthetic Industrial Anomaly Dataset):
- 覆盖 4 个基准数据集(MVTec-AD、MPDD、BTAD、VisA)的 36 个工业品类别
- 每类别 10,000 张,分辨率 256×256,共 360,000 张图像
- 异常强度 s 在 [0.1, 0.2] 均匀采样
- 可作为 DTD 的直接替代品,方便其他方法复用
四、创新点二:异常感知特征选择(AFS)
问题定义
给定大型预训练网络(如 WideResNet50)第 k 层的 ck 个特征图,AFS 的目标是从中选择
个最具异常判别力的特征图用于重建。
选择标准:AFS 损失
AFS 为每个特征图
计算一个评估损失:

其中F(.)对特征差异图进行归一化并对齐到异常遮罩 Mn的分辨率。
该损失的物理意义:一个好的特征图应当在异常区域产生大的响应差异,而在正常区域响应差异趋近于零。AFS 损失越小,该特征图越能精确定位异常区域。
选择流程
- 利用 SDAS 合成的异常图像
构成评估集 - 对每层每个特征图单独计算

- 选取各层中
最小的前 mk 个特征图 - 将选取的特征图索引缓存,后续训练和推理直接复用(只需执行一次)
RealNet 在四个数据集上统一设定每层选取维度为 {256, 512, 512, 256}(对应 ResNet 的 4 个 Block 输出)。
AFS 的三重优势
相比传统手动选取部分层全部特征的方式:
- 减少冗余:在层内进行细粒度筛选,去除判别力弱的特征通道
- 扩大感受野:跨所有层选取,保留多尺度异常检测能力
- 灵活控制计算量:解耦预训练特征维度与用于检测的特征维度,可按需调整模型规模
五、创新点三:重建残差选择(RRS)
问题背景
完成多尺度特征重建后,各层重建残差
的异常信息密度差异显著。例如,细微的低级纹理异常只能被底层特征的残差捕捉,而高层残差对其几乎无响应。直接拼接所有残差会引入大量"噪声"残差,导致漏检。
RRS 的工作机制
将所有层的残差上采样至统一分辨率后拼接,得到全局残差
,然后:
- GlobalMaxPooling(GMP):对 E(An) 沿空间维度取最大值,得到每个残差通道的最大响应向量 E(GMP) ,反映局部异常的强度
- GlobalAveragePooling(GAP):对 E(An) 沿空间维度取均值,得到 E(GAP) ,反映全局分布式异常的程度
- 分别选取两者 Top-K 的通道索引,从 E(An) 中提取对应的残差切片
- 将 Max-TopK 与 Avg-TopK 拼接,得到
,送入判别器
Max&Avg 联合模式的优势
- Max 模式:擅长捕捉小范围局部异常(高强度、小面积)
- Avg 模式:擅长捕捉大范围分布式异常(低强度、大面积)
- 联合模式:兼顾两者,对不同尺度异常均有强召回能力

【此处配图:Figure 5——RealNet 在 MVTec-AD 上,不同 RRS 模式(Max / Avg / Max&Avg)和不同残差保留比例 P 下的 Image AUROC、Pixel AUROC、PRO 性能曲线图】
最终损失函数
RealNet 的总训练损失结合特征重建损失与分割监督损失:
![]()
六、实验结果
数据集与评估指标
实验在四个工业异常检测基准上展开:
- MVTec-AD:15 类(10 类物体 + 5 类纹理),5,354 张图像,最主流的基准
- MPDD:6 类金属工业品,光照复杂、背景不均匀
- BTAD:3 类工业产品真实图像
- VisA:12 类,9,621 张正常图 + 1,200 张异常图,含复杂结构(PCB)和多目标场景
评估指标:图像级 AUROC(Image AUROC)、像素级 AUROC(Pixel AUROC)、Per Region Overlap(PRO)。
所有实验使用统一的网络架构和超参数,骨干网络为 WideResNet50(ImageNet 预训练)。
6.1 MVTec-AD 主实验

RealNet 在 MVTec-AD 上取得:
- Image AUROC:99.65%(与 SimpleNet 并列 SOTA)
- Pixel AUROC:99.03%(超越所有已有方法)
- PRO:93.07%
值得注意的是,RealNet 在像素级精确定位上取得了最大优势,说明 RRS 模块对异常区域的精准定位具有显著效果。

【此处配图:Figure 4——RealNet 在 MVTec-AD 上的定性结果,展示异常图像、真值掩码、预测异常评分图的对比】
6.2 异常合成方法对比(SIA vs. 其他方法)

【此处配图/表:Table 1——在 MVTec-AD 上,分别用 SIA / DTD / NSA / CutPaste 训练 RealNet 的性能对比(Image AUROC / Pixel AUROC / PRO,按纹理类与物体类分别列出)】
实验结论:
- SIA 在物体类别上取得最优性能(Image AUROC 均值 99.57%,Pixel AUROC 98.93%),这类别更依赖结构性异常的生成质量
- SIA 综合均值(99.65% / 99.03% / 93.07%)明显超越 DTD(99.52% / 98.92% / 91.40%)、NSA(99.35% / 98.28% / 90.73%)和 CutPaste(98.73% / 98.14% / 86.40%)
- 尤其在 PRO 指标上,SIA 提升显著,表明其生成的异常形状与真实异常的形态分布更接近
6.3 MPDD 数据集


【此处配图/表:Table 3——在 MPDD 上,SIA / DTD / CutPaste 三种合成方法的对比(Image AUROC / Pixel AUROC / PRO)】
【此处配图/表:Table 4——RealNet 与 PatchCore、CFlow、PaDiM、SPADE、DAGAN、Skip-GANomaly 在 MPDD 上的对比(Image AUROC / Pixel AUROC)】
MPDD 数据集具有复杂光照和背景干扰,具有更高挑战性。RealNet 取得:
- Image AUROC:96.3%,超越此前最佳方法 CFlow(86.1%)+10.2%
- Pixel AUROC:98.2%
这一显著提升在未做任何数据集专项调参的条件下实现,充分体现了 RealNet 的跨数据集泛化能力。
6.4 其他基准
- VisA(复杂结构 + 多目标场景):Image AUROC 97.8%,Pixel AUROC 98.8%
- BTAD:Image AUROC 96.1%,Pixel AUROC 97.9%
6.5 消融实验
AFS 与 RRS 的贡献

【此处配图/表:Table 5(a)——AFS 与 RRS 消融实验结果(4 种组合配置下的 Image AUROC / Pixel AUROC / PRO)】
| 配置 | AFS | RRS | Image AUROC | Pixel AUROC | PRO |
|---|---|---|---|---|---|
| 1(基线) | ✗ | ✗ | 94.46/95.67 | 93.38/95.84 | 79.81/82.26 |
| 2 | ✓ | ✗ | 96.86 | 96.32 | 84.13 |
| 3 | ✗ | ✓ | 99.39/99.09 | 98.66/98.22 | 92.01/88.38 |
| 4(完整) | ✓ | ✓ | 99.65 | 99.03 | 93.07 |
关键发现:
- RRS 对性能提升的贡献最为显著(从配置1到配置3,Image AUROC 跃升约5个百分点)
- AFS 在 RRS 基础上进一步稳定地提升各项指标
- 仅用 AFS 而无 RRS 时(配置2),性能远低于完整模型,说明残差选择对于充分利用特征判别能力至关重要
异常强度 s 的影响

【此处配图/表:Table 5(b)——不同异常强度 s(0 / 0.1 / 0.2 / [0.1,0.2])下的性能对比】
- s=0 时(生成正常图像):混合时引入假阳性区域,PRO 最低(91.80%)
- s=0.1 或 s=0.2 单一值:表现良好但不如范围采样
- s in [0.1, 0.2] 均匀采样:覆盖更宽的异常模式范围,综合性能最优(PRO 93.07%),表明多样化异常强度训练能提升模型对真实异常的泛化能力
七、计算效率
RealNet 在保持 SOTA 精度的同时,具备出色的实用性:
- 推理速度:31.93 FPS(单张 NVIDIA GeForce RTX 3090)
- 推理显存:仅需 4GB GPU 内存
这得益于 AFS 对特征维度的有效压缩,使大型骨干网络(WideResNet50)的计算开销被控制在可接受的范围内。
八、总结与展望
RealNet 通过三个精心设计的模块,系统性地解决了工业图像异常检测中的核心挑战:
| 模块 | 解决的问题 | 核心机制 |
|---|---|---|
| SDAS | 合成异常不真实、不多样 | 扩散模型概率空间扰动采样 |
| AFS | 特征冗余与预训练偏差 | 基于合成样本的自监督特征评估选择 |
| RRS | 残差噪声导致漏检 | GMP+GAP 联合 Top-K 残差筛选 |
从更宏观的视角来看,RealNet 的贡献不仅在于刷新了多个基准上的 SOTA 数字,更重要的是:
- 提供了一种无需真实异常样本、无需外部数据的通用异常合成范式
- 建立了自适应特征选择的方法论,打破了"一套超参适配所有类别"的局限
- 构建并开放了 SIA 数据集,为后续研究提供了标准化的合成异常资源
未来值得探索的方向包括:将 SDAS 扩展至视频异常检测、探索更高效的特征选择策略以支持实时边缘部署,以及将 AFS 机制迁移至其他需要特征选择的视觉任务。
RealNet:一种具有真实合成异常的特征选择网络,用于异常检测&spm=1001.2101.3001.5002&articleId=159206515&d=1&t=3&u=f5b7ffd9d0844415bfcc5500718a22f8)
6147

被折叠的 条评论
为什么被折叠?



