论文题目:Low-Light Image Enhancement via Generative Perceptual Priors(基于生成性感知先验的微光图像增强)
会议:AAAI2025
摘要:虽然在增强可见性、检索纹理细节和减轻微光(LL)图像中的噪声方面已经取得了重大进展,但将当前的微光图像增强(LLie)方法应用于现实世界场景仍然是一个挑战,主要是由于遇到了不同的光照条件。此外,对视觉上逼真和有吸引力的增强效果的追求仍然是一个未被探索的领域。为了应对这些挑战,我们引入了一种新的LLie框架,该框架以视觉语言模型(VLM)为基础,以生成性感知先验(GPP-LLie)为指导。具体地说,我们首先提出了一种流水线,引导VLMS评估LL图像的多个视觉属性,并将评估量化以输出全局和局部感知先验。随后,为了将这些生成性知觉先验引入LLie,我们在扩散过程中引入了基于变压器的主干,并提出了一种新的层归一化(GPP-LN)和由全局和局部知觉先验指导的注意机制(LPP-ATTN)。大量的实验表明,我们的模型在成对的LL数据集上的性能优于现有的SOTA方法,并且在真实数据上表现出更好的泛化能力。
该代码在https://github.com/LowLevelAI/GPP-LLIE.上发布
GPP-LLIE:用视觉语言模型的生成感知先验驱动低光照图像增强
一、论文指出的核心问题
1.1 现有方法在真实场景中泛化性差
低光照图像增强(LLIE)已经取得了长足进步,但论文一开篇就指出一个长期被忽视的痛点:现有方法在真实场景中往往产生不平衡的增强结果,出现过曝伪影。根本原因在于,训练数据与真实拍摄场景的光照条件存在分布差异,而现有模型缺乏对多变光照条件的自适应感知能力。

【此处配图:图1 — 真实场景(MEF、NPE 数据集)上的视觉对比。展示 Input、SNR-Net、LLFlow、LL-SKF、RQLLIE、PyDiff、Ours 七列结果。对比方法或过曝、或颜色失真、或细节模糊,而本文方法在保持天空云彩细节、埃菲尔铁塔结构完整性和花枝纹理方面均显著更优。】
1.2 现有先验信息的局限性
论文系统梳理了已有的三类先验方法:
- 图像先验(边缘等):从严重退化的输入中预测准确先验非常困难,生成真实细节的能力有限;
- 语义先验:受限于预定义语义类别,泛化能力受约束;
- 光照图:提升图像质量有帮助,但在生成视觉上真实可信的细节方面效果有限。
近期有工作(DACLIP)尝试微调预训练 VLM 来对齐退化图像和干净图像的内容嵌入,但在有限数据上微调 VLM 存在过拟合风险,对未见数据的泛化性有限。
1.3 扩散模型与 Transformer 骨干的结合存在三大障碍
基于扩散模型(DM)的生成式 LLIE 是近年热点,但现有方法均使用卷积 U-Net 作为扩散骨干,忽视了 Transformer 的可扩展性优势。论文指出,直接将扩散 Transformer(DiT)用于 LLIE 存在三个根本障碍:
- 分辨率固定:DiT 原设计针对特定分辨率(256×256 或 512×512)输出,而 LLIE 需要处理任意尺寸的图像;
- 计算复杂度:ViT 的注意力计算复杂度随输入尺寸二次增长,不适用于高分辨率图像;
- 缺乏先验:原始 DiT 缺乏先验信息引导,对真实世界图像的泛化能力有限。
二、GPP-LLIE 的核心创新
针对上述三大问题,论文提出了 GPP-LLIE(Generative Perceptual Prior guided Low-Light Image Enhancement),其创新由两大主线构成,共同形成一个完整的框架。

【此处配图:图3 — GPP-LLIE 整体框架图。展示编码器 E、前向扩散过程、生成感知先验提取模块(输出全局分数 S 和局部质量图 M)、GPP-LLIE 网络 ε_θ(含 GPP-LN 和 LPP-Attn)、解码器 D 到最终结果 Î_out 的完整流程。】
2.1 创新一:从 VLM 提取生成感知先验的全新流水线
这是本文最核心的创新。与以往从退化图像中提取先验不同,论文另辟蹊径——从预训练 VLM(LLaVA)中提取生成感知先验。LLaVA 在海量图文对上预训练,并用 20 万条低级视觉相关指令-响应对(Q-Instruct)进行了微调,具备对未见图像的强大低级视觉感知能力。

【此处配图:图2 — 生成感知先验提取流水线。展示(a)输入图像分块 patchify,(b)与 LLaVA 的对话(评估命令示例),(c)基于 Sigmoid 的量化策略,(d)最终输出的全局分数和局部质量图。】
2.1.1 细粒度低级视觉评估
论文预定义了若干低级视觉属性(<Attribute>)供选择,并为每个属性提供精确定义(<Definition>):
- visibility(可见度):图像中细节的清晰度和可辨识程度;
- contrast(对比度):使物体与背景可区分的亮度或颜色差异;
- sharpness(锐度):细节清晰度和边缘清晰度。
对于 LLIE 任务,三个属性被逐一评估。除全局评估外,考虑到低光照图像内部各区域的可见度、对比度和锐度差异显著,论文还引入局部评估:将输入图像分块(patchify)为若干不重叠的 patch,每个 patch 分别送入 LLaVA 获得局部评估,从而实现细粒度增强引导。
2.1.2 基于 Sigmoid 的量化策略
LLaVA 的原始输出是 token 概率,论文观察到两个问题:(1)概率最高的 token(如"The")毫无意义;(2)相比单个 token,两个对立 logit("good"和"poor")之间的差值更符合人类感知。
基于此,论文设计了 Sigmoid 量化策略,用"good"和"poor"两个 token 的概率差来计算量化分数:
其中 和
分别是"good"和"poor"的概率,
是调制标量。对每个 patch 计算同样的分数,汇总后得到局部质量图 M(平滑后)。对比度、可见度、锐度三个属性的全局分数取平均得到全局感知分数 S,三属性的局部质量图拼接得到最终质量图 M。
2.2 创新二:感知先验引导的扩散 Transformer 网络
2.2.1 整体架构
GPP-LLIE 在潜在空间中运行扩散过程,以降低计算量。给定正常光图像 和低光图像
,编码器
将其映射到潜在表示
和
(下采样因子为 f)。前向扩散在
上进行;反向去噪过程由 LLaVA 提取的先验(全局分数 S、局部质量图 M)和低光潜在特征
共同引导。
为解决 DiT 的三大障碍,论文在每个 GPP-LLIE Block 中引入了两个专门设计的机制:
2.2.2 全局感知先验引导的层归一化(GPP-LN)
全局分数 S 通过 MLP 生成缩放和偏移参数 和
,对层归一化进行调制:
这样,全局先验就以一种轻量但有效的方式融入了每个 Transformer Block 的归一化过程,动态调整特征分布以反映图像的整体感知质量。
2.2.3 局部感知先验引导的注意力机制(LPP-Attn)
为应对 ViT 注意力的二次计算复杂度问题,GPP-LLIE 的注意力沿通道维度而非空间维度计算,大幅降低计算量。在此基础上,论文额外引入由局部质量图 M 引导的通道注意力机制:
- Query 由输入特征计算;
- Key 和 Value 的计算由局部感知先验 M 引导;
- 空间位置编码也由局部先验 M 学习,而非预定义,从而使模型可处理任意尺寸图像。
2.2.4 Concat-and-Remove 策略
在每个 GPP-LLIE Block 中,首先将低光特征 拼接(concat)到输入以引入低光信息;在 Block 末尾移除(remove)后半段通道,使
能在下一个 Block 开始时再次拼接。这一策略在保持信息流连续性的同时,避免了特征维度的持续膨胀。
三、实验结果
3.1 训练设置
- 优化器:AdamW,学习率
;
- 训练迭代:所有数据集均训练 1.5M 次;
- 输入裁剪:320×320,batch size = 16;
- 数据增强:水平翻转和旋转;
- 扩散时间步:训练时 1000 步,推理时加速至 25 步;
- 训练数据集:LOL(485对)、LOL-v2-real(689对)、LOL-v2-syn(900对)。
3.2 配对数据集定量结果
评估指标:FID(越低越好)、LPIPS(越低越好)、DISTS(越低越好)、PSNR(越高越好)。

【此处配表:表1 — 在 LOL、LOL-v2-real、LOL-v2-synthetic 三个数据集上与 KinD、MIRNet、DRBN、SNR-Net、URetinex-Net、LLFlow、RQLLIE、Retinexformer、CUE、CLEDiff、LL-SKF、Reti-Diff、PyDiff、DiffLL 共 14 个方法的全面定量对比(FID/LPIPS/DISTS/PSNR)。】
核心数据一览(LOL 数据集),论文特别强调三组关键数字:
- FID 领先幅度:在 LOL、LOL-v2-real、LOL-v2-syn 上分别超越当前最优 23.6%、37.4%、26.5%,体现了方法在感知质量上的显著优势;
- LPIPS 领先:显著超越 PyDiff 18.4%;
- 全面最优:在 3 个数据集的全部 4 项指标上均取得最优或次优。
3.3 配对数据集定性结果

【此处配图:图4 — 配对数据集(LOL 第1行、LOL-v2-real 第2行、LOL-v2-syn 第3行)上的视觉对比。对比 Input、LLFlow、Retinexformer、RQLLIE、PyDiff、Ours、GT 七列。前几种方法普遍产生过度平滑结果,纹理细节丢失;本文方法产生更清晰的图像,保留盆栽植物叶片结构(第1行)、木地板纹理和轮廓(第2行)、树枝边缘清晰度(第3行)。】
3.4 真实无参考数据集定量结果
使用 NIQE(无参考质量评估,越低越好)在 MEF、LIME、DICM、NPE 四个真实场景数据集上评估。所有方法均使用在 LOL 训练集上训练的权重,以确保公平比较。

【此处配表:表2 — 真实场景数据集(MEF、LIME、DICM、NPE)上各方法的 NIQE 定量对比。】
本文方法在 MEF、LIME、DICM 三个数据集上取得最优,NPE 上取得次优,均值最低(3.67),充分验证了跨数据集的强泛化能力——这正是因果引导感知先验的核心价值所在。
3.5 真实数据集定性结果

【此处配图:图5 — DICM 真实场景数据集上的视觉对比(Input、SNR-Net、LLFlow、LL-SKF、RQLLIE、PyDiff、Ours)。本文方法有效处理原始图像中多样且不均匀的光照分布,在提升亮度和对比度的同时,避免了原本明亮区域的过曝,保持了自然色彩。】
四、消融实验
4.1 局部感知先验与 LPP-Attn 的作用

【此处配表:表3(a) — 消融实验(LOL 数据集)。对比完整 GPP-LLIE、Variant 1(去除局部先验和 LPP-Attn)、Variant 2(用 StableSR 的空间特征变换层替换 LPP-Attn)的 FID/LPIPS/DISTS/PSNR。】
关键数据:与 Variant 1 相比,完整 GPP-LLIE:
- FID 从 49.83 降至 36.73;
- LPIPS 从 0.103 降至 0.081;
与 Variant 2(用 StableSR 的空间特征变换层替换 LPP-Attn)相比,本文的 LPP-Attn 在 FID、LPIPS、DISTS 上分别低 22%、19%、22%,证明了提出的局部先验引导注意力机制的优越性。
4.2 全局感知先验与 GPP-LN 的作用
【表3(b) — 消融实验(LOL 数据集)。对比 Variant 1(无全局先验但保留 LPP-Attn)、Variant 3(去除全局先验和 GPP-LN)、Variant 4(去除 GPP-LN,直接将全局分数加到噪声潜在特征上)。】
关键数据:
- Variant 3(无全局先验)vs Variant 1:FID 高出 23%,LPIPS 高出 10%,说明全局感知分数对增强质量至关重要;
- Variant 4(直接相加)vs Variant 1(GPP-LN):FID 高出 14.6%,LPIPS 高出 7.2%,说明用 GPP-LN 调制层归一化是融合全局先验的正确方式,简单相加效果远不如精心设计的调制机制。
五、GPP-LLIE 的可迁移性
论文还验证了生成感知先验的可迁移性:将提取的先验应用于其他 LLIE 模型,同样能带来性能提升。这说明 GPP 流水线是一个通用的、即插即用的先验提取模块,不局限于本文提出的扩散 Transformer 框架。
六、总结与思考
GPP-LLIE 的核心逻辑可以用一句话概括:与其费力从退化图像中推断先验,不如直接向"见过一切"的 VLM 询问。
这篇论文有几个值得关注的思路:
一、先验的来源从"图像本身"转向"外部知识"。 以往所有先验(边缘、语义、光照图)都从待处理的低质量图像中提取,而低质量输入本身就是信息缺失的,提取准确先验非常困难。GPP-LLIE 转而利用在海量数据上训练的 VLM 的感知能力,绕开了这个根本矛盾。
二、量化策略的设计体现了对 VLM 输出特性的深刻理解。 不使用最高概率 token,而是用"good"与"poor"的概率差经 Sigmoid 映射,这个设计既符合人类对图像质量的感知方式(正面评价 vs 负面评价),又解决了 LLaVA 输出中无意义高概率 token 的干扰问题。
三、在保证可变分辨率的同时引入 Transformer 骨干。 通过通道维度注意力替代空间注意力、由局部先验学习位置编码等设计,论文有效解决了将 DiT 迁移到 LLIE 任务的工程挑战。
局限性:论文需要在推理阶段调用 LLaVA 提取先验,这引入了额外的计算开销,实时性会受到影响。此外,VLM 的评估质量在极端光照或复杂场景下是否仍然可靠,值得进一步探讨。
如果你对视觉语言模型在图像复原中的应用、扩散模型的 Transformer 骨干设计,或低光照增强的评价体系有兴趣,欢迎进一步讨论。
GPP-LLie:基于生成性感知先验的微光图像增强&spm=1001.2101.3001.5002&articleId=161748071&d=1&t=3&u=1865c32a40094413b71a5d6adab2b03d)
1326

被折叠的 条评论
为什么被折叠?



