CTE-Net: Contextual Texture EnhancementNetwork for Image Super-Resolution | 文献翻译

概要

图像超分辨率重建的目标是克服硬件成像条件和模式所施加的限制,旨在通过信号处理技术恢复图像中的高频细节。近年来,基于深度学习的单图像超分辨率重建SISR取得了显著的性能表现。然而,当前的方法在纹理细节重建方面表现不足,这给进一步提高超分辨率重建的准确性带来了挑战。在本研究中,我们提出了一种新颖的上下文纹理增强网络CTE-Net,旨在提高图像超分辨率中纹理细节的水平。

CTE-Net包含两个关键组件:多级特征聚合模块MFAM和上下文信息增强模块CIEM。MFAM从像素空间和通道维度整合全局和局部低分辨率LR特征,从而增强了网络的特征表示能力。CIEM通过整合精心设计的上下文注意力机制来增强网络的学习能力,该机制有效探索图像的邻近上下文信息,从而放大生成特征的表达能力。此外,我们利用局部二进制模式LBP来指导MFAM和CIEM的特征选择策略,从而使网络的决策逻辑优先倾向于纹理细节的恢复。广泛的实验表明,我们的方法取得了令人满意的结果。与最先进的方法相比,我们的方法在基准数据集上表现出更优越的性能。

关键词:图像超分辨率,上下文关联特征提取,纹理细节增强,多级特征聚合。

介绍

图1:CTE-Net生成的SISR结果。左侧显示低分辨率LR图像块,右侧展示对应的超分辨率SR结果。类型A表示具有丰富纹理的图像,类型B表示表面更平滑的区域。

随着信息技术的快速发展,各个领域对高质量图像的需求不断增加,如医学成像[1, 2, 3]、监控成像、卫星遥感[5, 6]、面部图像重建[34, 35]等。然而,受限于硬件能力和成像方法,图像采集过程中不可避免会丢失高频细节。因此,从原始场景中获取全面的详细信息仍然是一个重大挑战。作为基于硬件成像技术的有效补充,图像超分辨率SR重建近年来受到了广泛关注。图像SR重建的过程是从一系列低质量、低分辨率LR图像中恢复高质量、高分辨率HR图像,这些LR图像受到噪声、模糊和欠采样等因素的降质影响。由于其重要的实际应用价值,图像SR重建已成为多媒体应用领域的一个突出研究课题。

图像SR重建是一个典型的不适定问题,其中先验信息的引入在确保重建HR图像质量方面发挥关键作用。在过去几十年中,许多传统的基于实例的SR方法旨在通过稀疏编码、字典学习和线性或非线性回归等技术增强HR图像的先验信息。近年来,深度学习技术在模式识别中的成功应用促进了众多基于深度学习的SR方法的提出。这些方法旨在解决传统图像SR算法面临的挑战,包括高计算复杂度和次优的重建质量。Dong等人提出了开创性的基于深度卷积神经网络CNN的SR重建方法,称为SRCNN。它旨在学习LR和HR图像之间的映射关系,以获得更好的SR结果。随后,众多基于深度学习的图像SR重建方法被提出。这些方法大致可以分为两类:基于重建的方法和基于生成的方法。前者通过学习高分辨率和低分辨率之间的映射关系来恢复图像中的高频细节,而后者利用生成对抗网络GANs通过生成器和判别器之间的竞争过程生成HR图像。尽管基于生成的方法能够生成清晰的HR图像,但生成过程无法完全捕捉图像中原始信息,因此生成的HR图像可能与原始LR图像存在一定偏差。相反,基于重建的方法努力从原始LR图像中恢复高频成分,同时保持其所有原始信息不变。因此,基于重建的图像SR是一种更有意义的实现高质量结果的方法。

本研究主要关注基于重建的图像SR方法。鉴于大多数现有方法通常输出过于平滑且缺乏复杂的HR纹理细节,恢复纹理细节和边缘在决定重建图像的整体质量方面起着关键作用。然而,恢复纹理细节比恢复平滑区域更具挑战性。因此,一个出色的SR网络应专注于纹理细节的重建,以确保高质量的结果。此外,纹理细节的重建和恢复需要考虑通道之间的相关性、不同通道的重要性以及上下文相关性。上下文相关性能够从相邻空间位置有效提取补充信息,从而提高纹理细节重建的准确性。

我们提出了一种用于图像超分辨率的端到端上下文纹理增强网络CTE-Net,它包括特征提取模块、多级特征聚合模块、上下文信息增强模块和重建模块。在特征提取阶段中,我们引入局部二值模式LBP以增强网络在LR图像中捕获纹理细节的能力。多级特征聚合模块MFAM通过整合LR图像的全局和局部特征,同时强调通道相关性和重要性,增强了网络的特征重建能力。上下文信息增强模块CIEM整合上下文信息,并从邻近空间位置提取更细致的细节以用于纹理重建。CTE-Net的重建结果如图1所示。可以看出,该方法在纹理平坦区域和纹理丰富区域均取得了令人满意的结果。本研究的主要贡献总结如下:

1、我们提出了一种新颖的端到端SR网络CTE-Net,专门用于增强上下文纹理。我们将LBP引入框架中,以促进从LR图像中提取纹理特征,从而使网络优先恢复复杂的细节。该方法有效恢复了LR图像中的高质量纹理细节,从而提高了图像重建的质量。

2、我们构建了一个多级特征聚合模块,该模块结合了通道注意力和像素位置注意力,能够有效整合LR图像的全局和局部特征。这使得网络能够更多利用LR图像中不同层次的特征信息,从而实现更精确的SR结果。

3、我们设计了一个上下文信息增强模块,该模块有效扩展了感受野,并引导网络的决策逻辑捕捉上下文关系。因此,我们的模型能够利用相邻区域的空间位置信息,显著提高纹理细节重建的效果。

相关工作

最近,基于CNN的单图像超分辨率重建方法SISR的研究领域非常受欢迎,涌现了许多新的技术和网络结构。在本节中,我们将分析和讨论与我们方法相关的主要工作。

A基于CNN的超分辨率

最早的基于CNN的图像超分辨率重建工作之一是SRCNN[10]。尽管在精度上取得了进步,但这种方法在收敛速度慢和训练成本高方面遇到了挑战。为了打破计算瓶颈,一种非常深度超分辨率网络VDSR[11]和深度递归卷积网络DRCN[31]分别采用全局残差学习和递归学习技术,以扩大感受野并减少网络参数。这些方法在保持超分辨率精度的同时提高了计算效率。[18]提出了一种编码器-解码器网络RED,该网络利用对称的卷积-反卷积层组合,有效捕捉低分辨率到高分辨率图像之间的映射关系。这种方法展示了更快的收敛速度和更成功的重建结果。此外,信息蒸馏网络IDN[19]从原始低分辨率图像重建高分辨率图像,实现了重建精度和推理速度的平衡。尽管这些方法在加速训练速度和提高重建质量方面取得了显著成果,但它们通常在整合图像的多尺度信息方面存在不足,这可能导致在恢复复杂图像细节时出现某些局限性。

另一方面,大多数基于CNN的模型使用预定义的上采样算子(如双三次插值)将低分辨率图像放大到所需尺寸,这会导致重建图像出现视觉伪影。为了解决这一问题,深度递归融合网络DRFN[22]使用转置卷积代替双三次插值进行上采样,以实现更优的重建结果。多感受野网络MRFN[23]利用多感受野模块MRF提取和整合不同尺度的特征,从而提高了细节恢复映射的保真度并改善了重建质量。粗到细的超分辨率CNN模型CFSRCNN[21]通过有效利用网络层次结构中的低频和高频特征,增强了超分辨率模型的稳定性,从而解决了由上采样引起的振荡问题。全局-局部调整密集网络GLADSR[20]通过引入全局局部调整模块和可分离上金字塔采样模块,实现了性能提升和计算负载的降低。为了克服混叠伪影和高处理成本的问题,Zhang等人[24]提出了一种级联超分辨率卷积神经网络CSRCNN,以逐步的方式重建高分辨率图像。

总之,这些方法在提高图像重建质量方面取得了显著进展。然而,在多尺度特征融合、图像细节恢复和计算效率方面仍存在需要解决的挑战。

B基于注意力机制的超分辨率

近年来,一些杰出工作致力于利用注意力机制来提高图像超分辨率的性能。因此,众多基于注意力的CNN模型[37]和Transformer模型[54]应运而生。非常深的残差通道注意力网络RCAN[26]将通道注意力机制引入残差网络,提出了用于图像超分辨率重建的基于注意力机制的深度残差网络。这种方法在精度和视觉效果增强方面取得了卓越的成果。动态残差自注意力网络DRSAN[17]引入了基于动态残差注意力DRA的动态残差连接,能够根据输入统计信息自适应调整其结构,从而在计算复杂度和网络性能之间实现平衡。在[58] 中,作者提出了一种新颖的顺序注意力分支,为每个像素分配重要权重以增强高频细节。这种方法有效地在计算效率和重建精度之间实现了平衡。

基于CNN的图像超分辨率重建方法主要集中在设计更宽或更深的网络结构,它们往往忽视了中间层特征之间的相互作用。为了解决这一局限性,提出了一种新颖的整体注意力网络[27],通过探索层、通道和位置之间的相互依赖关系,有效捕获信息丰富的特征。因此,它在超分辨率任务中实现了卓越的性能。二阶注意力网络SAN[28]通过使用二阶特征统计信息自适应地重新调整通道特征,以获得更具判别力的表示。这种方法克服了CNN SISR方法忽视中间层特征相关性的局限性。此外,[48]引入了一个由Transformer和CNN组成的双分支模块,通过在CNN分支中引入基于局部变化的注意力块,利用低分辨率图像的局部和非局部特征。该模块能够直接从邻近像素变化中提取特征,从而增强重建能力。

C基于残差结构的超分辨率

自Kai等人[29]首次将残差结构引入CNN以来,这种结构有效解决了深度学习中的网络退化问题,残差学习技术在图像超分辨率领域迅速流行起来。残差结构有效地促进了深度网络中的信息传递,从而缓解了网络训练过程中遇到的挑战,并使得开发更深的网络成为可能。

[30]提出了一种双重残差递归网络DRRN,该网络有效地结合了全局和局部残差学习策略,简化了超分辨率模型的训练过程,并实现了卓越的重建性能。此外,残差密集网络RDN[32]集成了密集连接和残差学习技术,能够高效地从低分辨率图像中提取特征信息,同时确保更广泛网络的稳定训练。更深的存储网络MemNet[33]使用残差技术从不同层提取特征,并在SISR中增强前一层的影响,从而实现了性能提升。为了简化模型复杂性,深度递归卷积网络DRCN[31]引入了递归监督和跳跃连接,以缓解训练困难。

研究方法

图2:提出的CTE-Net框架。CTE-Net由特征提取模块、上下文信息增强模块CIEM、多级特征聚合模块MFAM和重建模块组成。

图3:CIEM的结构图。CIEM的架构使用5×5和3×3卷积来提取关键点之间的上下文信息。

图4:提出的多级特征聚合模块MFAM的组成部分。(a)通道注意力模块CAM。(b)像素位置注意力模块PAM。(c)特征融合模块FFM。本节中,我们将详细描述提出的CTE-Net。

CTE-Net的框架如图2所示。CTE-Net由特征提取模块、多级特征聚合模块、上下文信息增强模块和重建模块组成。特征提取模块包括卷积流和LBP流,其中后者用于增强网络对纹理信息的关注。精心设计的MFAM是CTE-Net的基础,它结合了PAM和CAM。通过强调通道之间的相关性和重要性,MFAM有效地聚合了低分辨率图像的全局和局部特征。不同层级的低分辨率特征信息可以有效地用于推断高分辨率特征。CIEM引导网络的决策逻辑关注上下文关系,增强网络对全局图像信息的感知和理解,从而提高纹理细节的重建精度。最终,通过在重建模块中利用学习到的高分辨率特征,实现高分辨率图像的重建。

A网络架构

设ILR和ISR分别表示输入低分辨率图像和对应的输出高分辨率图像。首先,我们使用卷积操作和平行的LBP来从低分辨率图像中提取浅层特征F0:

其中fCONV(·)表示卷积运算,fLBP(·)表示局部二值模式LBP特征提取函数。

设F₀为CIEM的输入,并利用上下文信息增强学习获取低分辨率特征F₁。该过程能表示为:

其中fCIEM(·)表示CIEM运算。

设F₁为MFAM的输入。具体而言,可以假设存在N个MFAM模块,第N个MFAM模块的输出FN可以表示为:

其中fPAM(·)表示通过PAM进行特征提取,fCAM(·)表示通过CAM进行特征提取,fFFM(·,·)表示特征融合。FN表示通过第N个MFAM运算所获得的特征。

在MFAM之后,利用CIEM进行全局学习以增强重建结果。该运算可以表示为:

其中FN表示通过MFAM提取的特征。

最终重建模块采用亚像素卷积,随后是一个卷积层,CTE-Net的输出可以表示为:

其中f↑表示上采样运算。

B上下文信息增强模块

如图3所示,对于一个输入特征图X,其维度为C×H×W,Key、Query和Value定义如下:K=WkX,Q=WqX,V=WvX。最初,空间上下文编码应用于k×k和q×q网格内的所有相邻键,以获得上下文键K1和Q1。随后,通过连接从K1和Q1获得的局部邻近键的上下文信息,经过1×1卷积和Softmax操作,得到注意力矩阵A:

其中f(·)表示1×1卷积操作,δ表示Softmax函数。

A的每个空间位置的局部注意力矩阵本质上是通过利用富含上下文信息的查询和键构建的。随后,该矩阵A与V相乘,得到加权特征图K2:

最终,通过融合加权特征图K1和K2,得到最终输出:

C多级特征聚合模块

多级特征聚合模块MFAM的组成如图4所示,其中通道注意力模块CAM如图4-a所示。为了将输入特征图F的维度从C×H×W降低到C×1×1,采用了一个并行池化层。随后,通过通道压缩(压缩比为1/r,其中r表示压缩因子)将特征图的通道数减少,并通过卷积层将其扩展回原始通道数。通道注意力的输出通过Sigmoid激活函数获得,然后与原始特征图相乘以得到最终输出。

其中σ表示Sigmoid函数,f(·)表示卷积操作,AvgP(·)表示平均池化,MaxP(·)表示最大池化。

位置注意力模块PAM如图4-b所示。输入特征F的尺寸为C×H×W,被重塑为一个二维矩阵,其维度为C×(H×W)。随后,通过矩阵乘法及其对应的转置操作,可以计算不同像素位置之间的相关性。

其中δ(·)表示Softmax函数,T表示转置操作,⊗表示矩阵乘法。

经过重塑的特征随后与相关矩阵ω相乘,并以以下方式加到输出特征中。

其中ω表示不同像素之间的相关矩阵。

为了更有效地整合获得的深层语义特征,我们提出了一种特征融合模块,如图4-c所示。对于输入特征FCAM和FPAM,其维度为C×H×W,设Fin=FCAM+FPAM。与公式G(Fin)和L(Fin)不同的是,输入特征Fin首先经过全局平均池化操作。

其中σ表示Sigmoid函数。

综上所述,我们提出的多级特征聚合模块可以表示为:

D损失函数

在本研究中,模型是通过一组训练对集{IiLR​,IiHR​}i=1M训练的,其中M表示训练集的大小,第i个低分辨率LR和高分辨率HR训练图像分别用IiLR和IiHR​表示。损失函数定义如下:

其中L2​表示均方误差损失,LSSIM​表示结构相似性损失。在实验中,我们设置α=0.7,β=0.3。

实验

在本节中,我们展示了所提出的方法在实验中的性能评估与分析。实验分为四个部分:首先介绍数据集及其预处理;其次描述实现细节以及评估指标;然后对所提出模块进行消融研究并分析其各个组成部分的贡献;最后与最新方法进行定量和定性的比较与分析。

A数据集

我们使用来自公开DIV2K数据集[38]的800张高分辨率HR图像,以及从Flickr2K[62]中获取的额外2650张训练图像,作为指定的训练数据集。DIV2K数据集包含1000张高质量RGB图像,分辨率为2K。训练集包含800张图像,而验证集和测试集各包含100张图像。Flickr2K数据集包含2650张高清图像,涵盖广泛的主题,包括但不限于人物、动物和风景。为了在测试集上评估我们训练的超分辨率SR模型的性能,我们使用了五个基准数据集:Set5[39]、Set14[40]、BSD100[41]、Urban100[42]以及Manga109[43]。Set5和Set14数据集分别包含来自多种场景的5张和14张图像;BSD100数据集(B100)和Urban100数据集(U100)分别包含100张高质量图像;Manga109包含109张卡通插图。我们采用数据增强技术,如随机水平翻转以及90°、180°和270°的旋转,从而扩展训练数据集。

B实现细节

在CTE-Net中,第一层和最后一层卷积层的核大小为9×9。特征提取模块、MFAM和CIEM配备了G₀=64个滤波器。CTE-Net总共包含G个MFAM。在训练过程中,我们使用ADAM优化器来优化模型参数,初始参数设置为β₁=0.9、β₂=0.999和ϵ=1e-8。初始学习率设置为1e-4,并在每4e+5步后减半,遵循先前研究[49]、[50]、[51]、[52]、[53]的惯例。评估指标包括PSNR和SSIM。由于训练仅仅关注亮度通道[44]、[45]、[46]、[47]、[48](YCbCr色彩空间中的Y通道),这两个指标也在Y通道上计算,以评估单图像超分辨率SISR性能。所有实验均在NVIDIA RTX 3090 24GB GPU上使用Pytorch 1.11.0进行。

C网络架构分析与消融研究

表1:LBP的消融研究及PSNR/SSIM报告。

表2:MFAM中CAM、PAM和FFM的消融实验结果。

表3:在Set14数据集上对CAM和PAM序列的调查结果。

图5:CTE-Net有无LBP的视觉比较。

图6:SRResNet、EDSR、RCAN和CTE-Net中基础模块的比较。(a) SRResNet的基础模块;(b) EDSR的基础模块;(c) RCAN的基础模块;(d) CTE-Net的基础模块。

表4:CIEM的有效性研究。

表5:在Set14和BSD100数据集上,使用4×放大因子时,不同损失函数的PSNR和SSIM结果比较。

图7:不同位置的CIEM结构。(a) 基础模块;(b) CTE_FC仅包含一个CIEM,位于MFAM模块组之前;(c) CTE_BC仅包含一个CIEM,位于MFAM模块组之后;(d) CTE_TC包含两个CIEM。

图8:使用不同损失函数进行图像重建的视觉效果,放大因子为4×。

在本节中,我们研究了所提出的上下文纹理增强网络结构的有效性。为此,我们分析了模型中各个组成部分的设计理念和贡献,包括CIEM、MFAM和上下文纹理增强网络。

1、网络架构分析:由于低分辨率LR图像通常缺乏高频信息,模型需要优化对各种特征的关注,以实现最佳的重建结果。这一优化过程不仅涉及从LR图像中提取可用信息,还包括从上下文中恢复潜在的纹理细节。为此,我们提出了一个新的多级特征聚合模块MFAM和上下文信息增强模块CIEM。前者旨在优化神经网络对各种特征的关注程度,并以更合理的方式分配网络资源。后者通过捕获上下文信息,扩大感受野并提高全局特征提取能力。此外,我们引入了局部二进制模式LBP,迫使网络的决策逻辑更多地关注图像的纹理信息。MFAM和CIEM的协同作用使CTE-Net能够全面感知和理解图像纹理细节,从而显著提高视觉质量和细节保留能力,进而实现卓越的SR重建结果。为了证明我们模型设计的合理性和必要性,我们进行了消融研究,以阐明不同组成部分的贡献。

2、LBP的消融研究:我们研究了LBP在图像超分辨率任务中的作用。为了便于实验,我们将MFAM的数量设置为G=10,并使用DIV2K作为训练数据集。我们使用PSNR/SSIM指标评估CTE-Net模型的性能,其中一个模型包含LBP,另一个不包含。结果如表1所示,从中可以看出,参数数量和计算FLOPs方面没有显著差异。这意味着引入LBP并未显著增加模型的复杂性。然而,与不包含LBP的模型相比,包含LBP的模型在PSNR和SSIM方面表现出更优的结果。这进一步表明引入LBP可以有效提高超分辨率重建的性能。此外,我们还进行了定性的视觉比较,比较了使用LBP和不使用LBP的情况,如图5所示。结果表明,当不使用LBP时,重建图像的某些区域会出现局部模糊或失真细节。然而,引入LBP后,图像中的纹理细节得到了更清晰、更逼真的恢复。这进一步证实了使用LBP进行超分辨率重建的有效性。

3、MFAM的消融实验:与现有方法(如SRResNet[12]、EDSR[13]和RCAN[26])中使用的基模块不同,所提出的MFAM集成了通道注意力和空间注意力,如图6所示。EDSR通过增加模型规模并消除SRResNet中使用的归一化层来提高超分辨率质量。另一方面,RCAN引入了通道注意力,以动态调整每个通道的特征。然而,RCAN仅关注网络中的通道维度注意力,忽略了空间维度注意力,这限制了其恢复图像高频信息的能力。通过整合从通道和像素空间维度提取的特征,MFAM获得了更具代表性的深度语义特征,以优化网络对不同特征的关注。MFAM中不同组成部分的消融研究如表二所示。我们没有使用CAM、PAM和FFM组件,而是使用图6-a中所示的基础模块作为基准模块。通过在每个MFAM中移除通道注意力单元或/和像素位置注意力单元或/和特征融合单元,进行了实验。所有五个模型的G值相同(G=10)。如表2所示,CAM和PAM可以独立使用,以提高超分辨率重建的性能。具体而言,仅使用CAM而不使用PAM在Set14测试集上可以将PSNR提高0.17dB(4×),而仅使用PAM也可以将PSNR提高0.12dB。通过将CAM和PAM与特征融合模块结合,PSNR可以进一步提高0.22dB。所提出的CAM和PAM仅增加了0.07M的参数和2.88G的计算复杂度,这证明了尽管增加了参数和计算成本,但这种设计具有很高的优势。此外,实验结果进一步验证了所提出的MFAM结构在提高超分辨率网络性能方面的有效性。此外,为了评估CAM和PAM不同顺序对超分辨率结果的影响,我们开发了三个实验模块:CTECP(CAM在PAM之前)、CTEPC(PAM在CAM之前)和CTECorP(CAM和PAM同时并行使用)。如表3所示,当PAM位于CAM之前或两者同时使用时,超分辨率性能可以得到提升。因此,可以认为MFAM模块中CAM和PAM的组合能够同时对通道维度和像素空间维度的语义信息进行建模,从而在不同层次上更好地关注图像的关键特征,如纹理和边缘。这种设计显著提高了超分辨率网络的性能。

4、CIEM的消融实验:为了评估所提出CIEM模块的有效性,我们使用了一个包含3×3卷积层和G组MFAM模块的基础模块。基础模块的架构如图7-a所示,而图7-b展示了在MFAM组前仅有一个CIEM模块的框架,图7-c展示了仅在MFAM组后有一个CIEM模块的结构。最后,图7-d展示了一个包含两个CIEM模块的架构。这些模块分别位于不同的位置,即基础模块、CTE_FC、CTE_BC和CTE_TC。表四列出了包括Set5、Set14、BSD100、Urban100和Manga109数据集在内的PSNR和SSIM值。表四中的结果表明,通过在MFAM模块组之前和之后引入CIEM,超分辨率性能得到了显著提升。特别是CTETC模型,其参数数量和计算复杂度相对较低。总之,这些观察结果验证了CIEM和MFAM各自的有效性,同时强调了它们结合时的协同优势。此外,这也强调了在超分辨率网络中有效建模高分辨率特征时,结合局部和全局信息的重要性。

5、损失函数的设计:在超分辨率SR任务中,我们的目标是生成高质量且细节丰富的图像,使其与原始高分辨率HR图像非常相似。选择合适的损失函数对于实现超分辨率结果的最优性能至关重要。在本分析中,我们研究了多种损失函数的有效性,包括L1、L2、L1_Charbonnier、L1+LSSIM和L2+LSSIM。

表5中的结果表明,L2和LSSIM损失函数的组合相比其他选择能够提供更优越的重建性能。在实验中,我们为L2和LSSIM分配了权重α₁=0.7和β₁=0.3,而L1和LSSIM的组合被分配了权重α₂=0.6和β₂=0.4。使用不同损失函数进行重建的视觉效果如图8所示,很明显,L2和LSSIM的组合能够产生最清晰的超分辨率结果。

D网络性能分析

图9:不同数量MFAM模块的可视化热力图。

图10:PSNR性能与MFAM模块数量G的关系。结果基于Set14数据集,放大因子为4×。

图11:网络参数与性能的比较结果,放大因子为4×。红色五角星表示由提出的CTE-Net获得的结果。

表6:在Set5(×4)上不同方法的运行时间比较。

1、特征图可视化:为了深入研究图像中MFAM和CIEM的关注区域及其对超分辨率重建任务的影响,我们在图9中展示了一个可视化的热力图。如图9所示,当MFAM模块的数量有限时,网络主要关注少数纹理特征。然而随着MFAM模块数量的增加,网络逐渐将注意力转向更复杂和详细的纹理特征。这表明,增加MFAM模块的数量增强了网络捕捉图像中复杂纹理细节的能力,从而进一步提高了图像重建的质量。此外,提出的CIEM模块结合了尺寸为5×5、3×3和1×1的滤波器的卷积操作。这种设计使网络能够通过包含不同感受野有效地捕捉全局和远程图像特征。通过协同整合MFAM和CIEM,我们的模型展示了在准确建模图像的整体结构和复杂纹理细节方面的增强能力,从而显著提高了图像超分辨率重建的性能。
2、参数设置研究:CTE-Net的能力主要由两个关键参数决定:MFAM模块的数量G和CIEM的位置。在本小节中,我们研究这些参数对图像超分辨率的影响。最初,我们将CIEM从CTE-Net中分离出来,并对不同数量的MFAM模块进行实验,范围从8到20。图10-a展示了参数G在Set14数据集上的PSNR性能曲线。图10中的结果清楚地表明,增加MFAM模块的数量G对超分辨率性能有积极影响。在图10-b中,我们在网络中保持了两个CIEM,并将MFAM的数量G分别设置为8、10、16和20。图10-b中的PSNR性能曲线与图10-a相比,后者缺乏CIEM,显示出PSNR结果的显著改进。这突出了网络从不同维度高效聚合局部和全局特征信息的能力,当CIEM和MFAM有效协同工作时,能够产生更精确的超分辨率结果。此外,我们研究了PSNR与参数数量之间的关系,并在Urban100数据集上使用×4放大因子,将我们提出的方法与几种最先进的模型进行了比较。比较的模型包括SRCNN[10]、VDSR[11]、DRRN[30]、IDN[19]、DRCN[31]、LapSRN[55]、MemNet[33]、SRResNet[12]、IMDN[14]、CFSRCNN[21]和CARN[36]。结果如图11所示,我们的方法用红色五角星表示。与其他方法相比,包括参数较少的IDN和MemNet,我们的方法在PSNR方面表现出优越的性能。此外,与经典的DRCN、CFSRCNN和CARN模型相比,我们的方法不仅减少了参数数量,还实现了卓越的超分辨率结果。
3、运行时间研究:我们在Set5(×4)上比较了不同方法的时间和参数,结果如表VI所示。可以看出,与SRResNet和DRCN相比,我们的方法不仅参数较少,而且获得了优越的超分辨率结果。这主要归功于提出的MFAM和CIEM所提供的优势。MFAM通过采用更有效的特征提取和融合方法,减少了参数数量和计算成本。另一方面,CIEM增强了纹理特征重建,增强了网络学习全局图像特征的能力,从而提高了超分辨率结果的整体效率和准确性。

E与最新技术的比较

表7:与最新超分辨率SR方法的定量评估结果比较,放大倍数为×2、×3和×4。

图12:在Set14、BSD100和Urban100数据集上使用×2、×3和×4放大倍数的定性比较。

表8:CTE-Net与最新方法的定量比较结果。

图13:在DTD和STex数据集上(×4)的视觉比较。

在本节中,我们通过定量和定性分析评估了提出的CTE-Net的性能,并将其与单图像超分辨率SISR方法进行了比较。具体而言,我们通过测量它们在五个基准数据集上的平均PSNR/SSIM值和参数,定量评估了各种超分辨率方法。比较的方法包括SRCNN[10]、MemNet[33]、DRRN[30]、IDN[19]、FMEN[58]、DRCN[31]、CFSRCNN[21]、GLADSR[20]、IMDN[14]、CARN[36]、MADNet[15]、SMSR[16]、DRSAN[17]等。结果如表VII所示。表VII显示了不同超分辨率方法在Set5、Set14、BSD100、Urban100和Manga109数据集上的平均PSNR和SSIM性能。如表VII所示,CTE-Net在所有放大因子的五个数据集上,以SSIM衡量,优于现有技术。此外,CTE-Net在参数数量和计算复杂度FLOPs方面相对适中,与某些较大的模型(如DRCN、CARN)相比,性能优越。特别是,使用×2放大因子时,CTE-Net以较少的参数展现出优于DRCN、CARN和CFSRCNN等方法的性能。这表明CTE-Net在参数和模型效率之间达到了最佳平衡,同时通过引入上下文信息和特定注意力机制,有效增强了纹理细节恢复能力。因此,它在所有数据集上均取得了卓越的SSIM结果。
在图12中,我们展示了CTE-Net与最新方法在不同尺度上的视觉比较结果。显而易见,CTE-Net在图像重建方面表现出色,尤其是对于具有相对平坦纹理结构的图像“253027”和“img_092”。值得注意的是,CTE-Net有效地保留并恢复了图像中的丰富细节,取得了令人非常满意的结果。在处理具有复杂纹理的图像(如“img_076”、“img_077”)时,CTE-Net的性能同样出色。它有效减少了伪影和失真,同时保留了纹理细节,从而产生更真实、更自然的恢复图像。此外,与替代方法相比,CTE-Net在恢复纹理边缘的清晰轮廓方面表现出色。这进一步证明了我们提出的方法的有效性。
纹理数据集的评估:为了进一步证明CTE-Net在纹理重建方面的有效性,我们在纹理数据集DTD[56]和STex[57]上与几种最新方法(例如,SwinIR[59]、MSWSR[60]、NGramSwin[61])进行了定量比较。表VIII中的结果明确表明,CTE-Net优于这些方法,并在纹理数据集上取得了卓越的结果。这些结果突出了CTE-Net在捕捉和重建图像中复杂纹理细节方面的显著优势。
此外,我们还对CTE-Net与其他最新方法进行了定性分析,视觉比较如图13所示。显而易见,我们的方法在有效处理各种复杂纹理方面表现出色。与其他最新方法相比,CTE-Net通过保留复杂纹理细节、准确捕捉纹理结构并始终生成高质量纹理,超越了它们。这进一步证明了我们提出的CTE-Net在纹理恢复方面的有效性。

结论

本研究旨在解决图像超分辨率重建中恢复纹理细节的挑战。为了实现这一目标,我们提出了一种新颖的上下文纹理增强网络CTE-Net,用于单图像超分辨率重建。在所提出的方法中,我们将局部二进制模式LBP集成到CTE-Net中,引导网络的决策逻辑更加注重纹理细节,从而有助于推断出更清晰的纹理。此外,我们构建了多尺度特征聚合模块MFAM和上下文信息增强模块CIEM。MFAM通过在通道和像素维度整合语义特征,增强了网络在不同层次上的特征提取能力。CIEM扩展了感受野,以实现上下文信息处理,从而通过利用空间相邻位置增强上下文关系,促进纹理细节的重建。最后,我们在基准数据集上对我们的网络模型进行了全面评估。结果表明,我们的CTE-Net不仅在准确性方面表现出色,而且在重建丰富的纹理细节方面也表现出卓越的性能。在未来的研究中,我们将努力进一步优化网络参数,并开发轻量级的超分辨率重建模型,以满足计算资源有限的设备对实时应用的需求。

参考

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值