图像融合入门论文精选(2019–2025)

图像融合入门:精选论文(2019–2025)与常用数据集

这篇整理主要面向图像融合方向的入门与进阶读者,尤其是对红外–可见光融合、多模态医学 / 感知融合以及通用图像融合感兴趣的同学。

本文主要包含两部分内容:

  1. 论文精选:覆盖 2019–2025 年间较有代表性的深度学习方法(IVIF / 多模态 / 通用融合);
  2. 数据集速查:汇总了红外、医学、多曝光、多聚焦及遥感等领域的常用主流数据集,包括最新的视频融合数据集。

使用建议

  • 阅读顺序:从 2019 早期工作开始,逐步过渡到 Vision-Language、Diffusion 等最新方向;
  • 查阅方式:利用表格快速检索论文代码及对应的数据集下载地址。

更加系统、全面的论文/代码整理可以参考以下三份资源(强烈推荐一起对照阅读):

注:整理难免有疏漏,仅作为入门与方向梳理使用。


Part 1:精选论文汇总 (2019–2025)

1. 红外和可见光图像融合 (Infrared & Visible Image Fusion)

这一部分聚焦于 IVIF,从早期的卷积自编码器和 GAN,到近年来的 Vision-Language、Diffusion 与可控融合框架。

  • 分类说明
    • 面向视觉融合:侧重低层次视觉质量(细节、对比度、纹理);
    • 语义驱动融合:引入检测/分割/文本等高层任务或语义先验;
    • 联合配准融合:同时学习配准与融合,解决对齐问题;
    • 退化鲁棒融合:针对噪声、模糊、低照度等场景。
方法论文标题分类基础框架监督范式发表期刊或会议年份论文代码
ControlFusionControlFusion: A Controllable Image Fusion Network with Language-Vision Degradation Prompts语义
驱动
融合
Transformer

NeurIPS2025PaperCode
OmniFuseOmniFuse: Composite Degradation-Robust Image Fusion With Language-Driven Semantics联合
配准
融合
Diffusion
Model


TPAMI2025PaperCode
CDTFusionCDTFusion: Crossing Domain and Task for Infrared and Visible Image Fusion面向
视觉
融合
CNN

TPAMI2025PaperCode
DCEvoDCEvo: Discriminative Cross-Dimensional Evolutionary Learning for Infrared and Visible Image Fusion语义
驱动
融合
CNN

CVPR2025PaperCode
Dream-IFDream-IF: Dynamic Relative EnhAnceMent for Image Fusion退化
鲁棒
融合
CNN&
Transformer


arXiv2025PaperCode
SAGEEvery SAMDrop Counts: Embracing Semantic Priors for Multi-Modality Image Fusion and Beyond语义
驱动
融合
CNN

CVPR2025PaperCode
FreeFusionFreeFusion: Infrared and Visible Image Fusion via Cross Reconstruction Learning退化
鲁棒
融合
CNN

TPAMI2025PaperCode
FusionBoosterFusionBooster: A Unified Image Fusion Boosting Paradigm语义
驱动
融合
AE

IJCV2025PaperCode
MulFS-CAPMulFS-CAP: Multimodal Fusion-Supervised Cross-Modality Alignment Perception for Unregistered Infrared-Visible Image Fusion语义
驱动
融合
CNN

TPAMI2025PaperCode
OCCOOCCO: LVM-Guided Infrared and Visible Image Fusion Framework Based on Object-Aware and Contextual Contrastive Learning联合
配准
融合
CNN

IJCV2025PaperCode
TDFusionTask-driven Image Fusion with Learnable Fusion Loss语义
驱动
融合
CNN&
Transformer


CVPR2025PaperCode
MRFSMRFS: Mutually Reinforcing Image Fusion and Segmentation语义
驱动
融合
CNN&
Transformer


CVPR2024PaperCode
FILMImage Fusion via Vision-Language Model语义
驱动
融合
CNN&
Transformer


ICML2024PaperCode
TC-MoATask-Customized Mixture of Adapters for General Image Fusion面向
视觉
融合
Transformer

CVPR2024PaperCode
Text-IFText-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion语义
驱动
融合
Transformer

CVPR2024PaperCode
PSFusionRethinking the necessity of image fusion in high-level vision tasks…语义
驱动
融合
CNN

InfFus2023PaperCode
LRRNetLRRNet: A Novel Representation Learning Guided Fusion Network for Infrared and Visible Images面向
视觉
融合
CNN

TPAMI2023PaperCode
MURFMURF: Mutually Reinforcing Multi-Modal Image Registration and Fusion联合
配准
融合
CNN

TPAMI2023PaperCode
SegMiFMulti-interactive Feature Learning and a Full-time Multi-modality Benchmark for Image Fusion and Segmentation语义
驱动
融合
CNN&
Transformer


ICCV2023PaperCode
CAMFAMF: An interpretable infrared and visible image fusion network based on class activation mapping面向
视觉
融合
AE

TMM2023PaperCode
PAIFPAIF: Perception-Aware Infrared-Visible Image Fusion for Attack-Tolerant Semantic Segmentation语义
驱动
融合
CNN

ACM MM2023PaperCode
SeAFusionImage fusion in the loop of high-level vision tasks: A semantic-aware real-time infrared and visible image fusion network语义
驱动
融合
CNN

InfFus2022PaperCode
TarDALTarget-aware Dual Adversarial Learning and a Multi-scenario Multi-Modality Benchmark…语义
驱动
融合
GAN

CVPR2022PaperCode
PIAFusionPIAFusion: A progressive infrared and visible image fusion network based on illumination aware面向
视觉
融合
CNN

InfFus2022PaperCode
CSFClassification Saliency-Based Rule for Visible and Infrared Image Fusion面向
视觉
融合
AE

TCI2021PaperCode
RFN-NestRFN-Nest: An end-to-end residual fusion network for infrared and visible images面向
视觉
融合
AE

InfFus2021PaperCode
FusionGANFusionGAN: A generative adversarial network for infrared and visible image fusion面向
视觉
融合
GAN

InfFus2019PaperCode
DenseFuseDenseFuse: A Fusion Approach to Infrared and Visible Images面向
视觉
融合
AE

TIP2019PaperCode

2. 多模图像融合 (Multi-Modal Image Fusion)

主要总结 红外–可见光 + 医学 / 其他模态 的联合融合工作。这类方法往往更关注 模态互补性跨模态分布差异

方法论文标题分类基础框架监督范式发表期刊/会议年份论文代码
C2RFC2RF: Bridging Multi-modal Image Registration and Fusion via Commonality Mining and Contrastive Learning联合配准CNN无监督IJCV2025PaperCode
MTG-FusionMulti-Text Guidance Is Important: Multi-Modality Image Fusion via Large Generative Vision-Language Model语义驱动Diffusion有监督IJCV2025PaperCode
DRMFDRMF: Degradation-Robust Multi-Modal Image Fusion via Composable Diffusion Prior面向视觉Diffusion无监督ACM MM2024PaperCode
IVF-WoRegA Deep Learning Framework for Infrared and Visible Image Fusion Without Strict Registration联合配准CNN有监督IJCV2024PaperCode
CoCoNetCoCoNet: Coupled Contrastive Learning Network with Multi-level Feature Ensemble for Multi-modality Image Fusion面向视觉CNN无监督IJCV2024PaperCode
CCFConditional Controllable Image Fusion联合配准Diffusion无监督NeurIPS2024PaperCode
ReFusionReFusion: Learning Image Fusion from Reconstruction with Learnable Loss Via Meta-Learning退化鲁棒CNN无监督IJCV2024PaperCode
TTDTest-Time Dynamic Image Fusion面向视觉CNN无监督NeurIPS2024PaperCode
CDDFuseCDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for Multi-Modality Image Fusion语义驱动CNN&Trans无监督CVPR2023PaperCode
DDFMDDFM: Denoising Diffusion Model for Multi-Modality Image Fusion面向视觉Diffusion无监督CVPR2023PaperCode
DDcGANLearning a Generative Model for Fusing Infrared and Visible Images via Conditional Generative Adversarial Network with Dual Discriminators面向视觉GAN无监督IJCAI2019PaperCode

3. 通用图像融合 (General Image Fusion)

不限制具体模态,适配“红外 + 可见、医学、多曝光、多聚焦”等多种组合的统一框架,适合作为 General Backbone

方法论文标题基础框架监督范式发表期刊/会议年份论文代码
Mask-DiFuserMask-DiFuser: A Masked Diffusion Model for Unified Unsupervised Image FusionDiffusion无监督TPAMI2025PaperCode
GIFNetOne Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image FusionTransformer有监督CVPR2025PaperCode
SwinFusionSwinFusion: Cross-domain Long-range Learning for General Image Fusion via Swin TransformerTransformer无监督IEEE/CAA JAS2022PaperCode
U2FusionU2Fusion: A Unified Unsupervised Image Fusion NetworkCNN无监督TPAMI2022PaperCode
DeFusionFusion from Decomposition: A Self-Supervised Decomposition Approach for Image FusionCNN无监督ECCV2022PaperCode
SDNetSDNet: A Versatile Squeeze-and-Decomposition Network for Real-Time Image FusionCNN无监督IJCV2021PaperCode
PMGIRethinking the Image Fusion: A Fast Unified Image Fusion Network based on Proportional Maintenance of Gradient and IntensityCNN无监督AAAI2020PaperCode
IFCNNIFCNN: A general image fusion framework based on convolutional neural networkCNN有监督InfFus2020PaperCode

Part 2:常用数据集速查 (Datasets)

以下是图像融合领域主流的公开数据集汇总。为了便于查阅,这里按**应用场景(领域)**进行了统一列表。

适用场景 (Domain)数据集名称 (Name)简介/备注官方/下载链接 (Link)
红外/可见光图像M3SVD红外-可见光视频融合数据集Download
红外/可见光图像TNO经典的IVIF数据集Download
红外/可见光图像INO视频分析数据集,包含红外/可见光视频序列Download
红外/可见光图像RoadScene道路交通场景,由FLIR相机拍摄Download
红外/可见光图像MSRS多光谱道路场景,常用于语义分割融合Download
红外/可见光图像LLVIP低光照下的红外-可见光人员检测Download
红外/可见光图像M3FD多模态多场景融合检测数据集Download
红外/可见光图像FMBSegMiF 基准数据集,涵盖多种场景Download
医学图像Harvard包含CT/MRI/PET等多种医学模态图谱Download
多曝光图像MEF经典的静态场景多曝光序列Download
多曝光图像MEFB多曝光融合Benchmark,包含复杂场景Download
多聚焦图像Lytro光场相机拍摄的多聚焦图像集Download
多聚焦图像MFI-WHU武汉大学发布的多聚焦图像数据集Download
多聚焦图像MFFW包含不同焦距的现实场景拍摄图像Download
遥感影像GaoFen高分系列卫星影像数据Access
遥感影像WorldViewNASA WorldView,提供高分辨率地球观测Access
遥感影像GeoEyeGeoEye-1 卫星影像数据Access
遥感影像QuickBirdQuickBird 高分辨率商业卫星影像Access
视频融合(通用)VF-Bench通用视频融合 BenchmarkDownload

如果你有觉得“必须加入”的经典工作(特别是 2014–2018 年的一些早期深度方法,或者 2025 之后的最新 follow-ups),完全可以在这个表的基础上继续往下扩展。

欢迎在评论区分享你自己的阅读路线和实验心得,让这份“入门清单”变成一个持续更新的社区索引。😊

如需获取文中论文的完整 PDF,可以联系 **2458707789@qq.com ** (备注:姓名-学校 + “PDF获取”),统一打包发送。

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Timer-419

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值