图像融合入门:精选论文(2019–2025)与常用数据集
这篇整理主要面向图像融合方向的入门与进阶读者,尤其是对红外–可见光融合、多模态医学 / 感知融合以及通用图像融合感兴趣的同学。
本文主要包含两部分内容:
- 论文精选:覆盖 2019–2025 年间较有代表性的深度学习方法(IVIF / 多模态 / 通用融合);
- 数据集速查:汇总了红外、医学、多曝光、多聚焦及遥感等领域的常用主流数据集,包括最新的视频融合数据集。
使用建议:
- 阅读顺序:从 2019 早期工作开始,逐步过渡到 Vision-Language、Diffusion 等最新方向;
- 查阅方式:利用表格快速检索论文代码及对应的数据集下载地址。
更加系统、全面的论文/代码整理可以参考以下三份资源(强烈推荐一起对照阅读):
注:整理难免有疏漏,仅作为入门与方向梳理使用。
Part 1:精选论文汇总 (2019–2025)
1. 红外和可见光图像融合 (Infrared & Visible Image Fusion)
这一部分聚焦于 IVIF,从早期的卷积自编码器和 GAN,到近年来的 Vision-Language、Diffusion 与可控融合框架。
- 分类说明:
- 面向视觉融合:侧重低层次视觉质量(细节、对比度、纹理);
- 语义驱动融合:引入检测/分割/文本等高层任务或语义先验;
- 联合配准融合:同时学习配准与融合,解决对齐问题;
- 退化鲁棒融合:针对噪声、模糊、低照度等场景。
| 方法 | 论文标题 | 分类 | 基础框架 | 监督范式 | 发表期刊或会议 | 年份 | 论文 | 代码 |
|---|---|---|---|---|---|---|---|---|
| ControlFusion | ControlFusion: A Controllable Image Fusion Network with Language-Vision Degradation Prompts | 语义 驱动 融合 | Transformer | 无 监 督 | NeurIPS | 2025 | Paper | Code |
| OmniFuse | OmniFuse: Composite Degradation-Robust Image Fusion With Language-Driven Semantics | 联合 配准 融合 | Diffusion Model | 有 监 督 | TPAMI | 2025 | Paper | Code |
| CDTFusion | CDTFusion: Crossing Domain and Task for Infrared and Visible Image Fusion | 面向 视觉 融合 | CNN | 无 监 督 | TPAMI | 2025 | Paper | Code |
| DCEvo | DCEvo: Discriminative Cross-Dimensional Evolutionary Learning for Infrared and Visible Image Fusion | 语义 驱动 融合 | CNN | 无 监 督 | CVPR | 2025 | Paper | Code |
| Dream-IF | Dream-IF: Dynamic Relative EnhAnceMent for Image Fusion | 退化 鲁棒 融合 | CNN& Transformer | 有 监 督 | arXiv | 2025 | Paper | Code |
| SAGE | Every SAMDrop Counts: Embracing Semantic Priors for Multi-Modality Image Fusion and Beyond | 语义 驱动 融合 | CNN | 无 监 督 | CVPR | 2025 | Paper | Code |
| FreeFusion | FreeFusion: Infrared and Visible Image Fusion via Cross Reconstruction Learning | 退化 鲁棒 融合 | CNN | 有 监 督 | TPAMI | 2025 | Paper | Code |
| FusionBooster | FusionBooster: A Unified Image Fusion Boosting Paradigm | 语义 驱动 融合 | AE | 有 监 督 | IJCV | 2025 | Paper | Code |
| MulFS-CAP | MulFS-CAP: Multimodal Fusion-Supervised Cross-Modality Alignment Perception for Unregistered Infrared-Visible Image Fusion | 语义 驱动 融合 | CNN | 有 监 督 | TPAMI | 2025 | Paper | Code |
| OCCO | OCCO: LVM-Guided Infrared and Visible Image Fusion Framework Based on Object-Aware and Contextual Contrastive Learning | 联合 配准 融合 | CNN | 有 监 督 | IJCV | 2025 | Paper | Code |
| TDFusion | Task-driven Image Fusion with Learnable Fusion Loss | 语义 驱动 融合 | CNN& Transformer | 无 监 督 | CVPR | 2025 | Paper | Code |
| MRFS | MRFS: Mutually Reinforcing Image Fusion and Segmentation | 语义 驱动 融合 | CNN& Transformer | 无 监 督 | CVPR | 2024 | Paper | Code |
| FILM | Image Fusion via Vision-Language Model | 语义 驱动 融合 | CNN& Transformer | 无 监 督 | ICML | 2024 | Paper | Code |
| TC-MoA | Task-Customized Mixture of Adapters for General Image Fusion | 面向 视觉 融合 | Transformer | 无 监 督 | CVPR | 2024 | Paper | Code |
| Text-IF | Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion | 语义 驱动 融合 | Transformer | 无 监 督 | CVPR | 2024 | Paper | Code |
| PSFusion | Rethinking the necessity of image fusion in high-level vision tasks… | 语义 驱动 融合 | CNN | 无 监 督 | InfFus | 2023 | Paper | Code |
| LRRNet | LRRNet: A Novel Representation Learning Guided Fusion Network for Infrared and Visible Images | 面向 视觉 融合 | CNN | 有 监 督 | TPAMI | 2023 | Paper | Code |
| MURF | MURF: Mutually Reinforcing Multi-Modal Image Registration and Fusion | 联合 配准 融合 | CNN | 无 监 督 | TPAMI | 2023 | Paper | Code |
| SegMiF | Multi-interactive Feature Learning and a Full-time Multi-modality Benchmark for Image Fusion and Segmentation | 语义 驱动 融合 | CNN& Transformer | 有 监 督 | ICCV | 2023 | Paper | Code |
| CAMF | AMF: An interpretable infrared and visible image fusion network based on class activation mapping | 面向 视觉 融合 | AE | 自 监 督 | TMM | 2023 | Paper | Code |
| PAIF | PAIF: Perception-Aware Infrared-Visible Image Fusion for Attack-Tolerant Semantic Segmentation | 语义 驱动 融合 | CNN | 无 监 督 | ACM MM | 2023 | Paper | Code |
| SeAFusion | Image fusion in the loop of high-level vision tasks: A semantic-aware real-time infrared and visible image fusion network | 语义 驱动 融合 | CNN | 无 监 督 | InfFus | 2022 | Paper | Code |
| TarDAL | Target-aware Dual Adversarial Learning and a Multi-scenario Multi-Modality Benchmark… | 语义 驱动 融合 | GAN | 无 监 督 | CVPR | 2022 | Paper | Code |
| PIAFusion | PIAFusion: A progressive infrared and visible image fusion network based on illumination aware | 面向 视觉 融合 | CNN | 无 监 督 | InfFus | 2022 | Paper | Code |
| CSF | Classification Saliency-Based Rule for Visible and Infrared Image Fusion | 面向 视觉 融合 | AE | 无 监 督 | TCI | 2021 | Paper | Code |
| RFN-Nest | RFN-Nest: An end-to-end residual fusion network for infrared and visible images | 面向 视觉 融合 | AE | 无 监 督 | InfFus | 2021 | Paper | Code |
| FusionGAN | FusionGAN: A generative adversarial network for infrared and visible image fusion | 面向 视觉 融合 | GAN | 无 监 督 | InfFus | 2019 | Paper | Code |
| DenseFuse | DenseFuse: A Fusion Approach to Infrared and Visible Images | 面向 视觉 融合 | AE | 无 监 督 | TIP | 2019 | Paper | Code |
2. 多模图像融合 (Multi-Modal Image Fusion)
主要总结 红外–可见光 + 医学 / 其他模态 的联合融合工作。这类方法往往更关注 模态互补性 与 跨模态分布差异。
| 方法 | 论文标题 | 分类 | 基础框架 | 监督范式 | 发表期刊/会议 | 年份 | 论文 | 代码 |
|---|---|---|---|---|---|---|---|---|
| C2RF | C2RF: Bridging Multi-modal Image Registration and Fusion via Commonality Mining and Contrastive Learning | 联合配准 | CNN | 无监督 | IJCV | 2025 | Paper | Code |
| MTG-Fusion | Multi-Text Guidance Is Important: Multi-Modality Image Fusion via Large Generative Vision-Language Model | 语义驱动 | Diffusion | 有监督 | IJCV | 2025 | Paper | Code |
| DRMF | DRMF: Degradation-Robust Multi-Modal Image Fusion via Composable Diffusion Prior | 面向视觉 | Diffusion | 无监督 | ACM MM | 2024 | Paper | Code |
| IVF-WoReg | A Deep Learning Framework for Infrared and Visible Image Fusion Without Strict Registration | 联合配准 | CNN | 有监督 | IJCV | 2024 | Paper | Code |
| CoCoNet | CoCoNet: Coupled Contrastive Learning Network with Multi-level Feature Ensemble for Multi-modality Image Fusion | 面向视觉 | CNN | 无监督 | IJCV | 2024 | Paper | Code |
| CCF | Conditional Controllable Image Fusion | 联合配准 | Diffusion | 无监督 | NeurIPS | 2024 | Paper | Code |
| ReFusion | ReFusion: Learning Image Fusion from Reconstruction with Learnable Loss Via Meta-Learning | 退化鲁棒 | CNN | 无监督 | IJCV | 2024 | Paper | Code |
| TTD | Test-Time Dynamic Image Fusion | 面向视觉 | CNN | 无监督 | NeurIPS | 2024 | Paper | Code |
| CDDFuse | CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for Multi-Modality Image Fusion | 语义驱动 | CNN&Trans | 无监督 | CVPR | 2023 | Paper | Code |
| DDFM | DDFM: Denoising Diffusion Model for Multi-Modality Image Fusion | 面向视觉 | Diffusion | 无监督 | CVPR | 2023 | Paper | Code |
| DDcGAN | Learning a Generative Model for Fusing Infrared and Visible Images via Conditional Generative Adversarial Network with Dual Discriminators | 面向视觉 | GAN | 无监督 | IJCAI | 2019 | Paper | Code |
3. 通用图像融合 (General Image Fusion)
不限制具体模态,适配“红外 + 可见、医学、多曝光、多聚焦”等多种组合的统一框架,适合作为 General Backbone。
| 方法 | 论文标题 | 基础框架 | 监督范式 | 发表期刊/会议 | 年份 | 论文 | 代码 |
|---|---|---|---|---|---|---|---|
| Mask-DiFuser | Mask-DiFuser: A Masked Diffusion Model for Unified Unsupervised Image Fusion | Diffusion | 无监督 | TPAMI | 2025 | Paper | Code |
| GIFNet | One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion | Transformer | 有监督 | CVPR | 2025 | Paper | Code |
| SwinFusion | SwinFusion: Cross-domain Long-range Learning for General Image Fusion via Swin Transformer | Transformer | 无监督 | IEEE/CAA JAS | 2022 | Paper | Code |
| U2Fusion | U2Fusion: A Unified Unsupervised Image Fusion Network | CNN | 无监督 | TPAMI | 2022 | Paper | Code |
| DeFusion | Fusion from Decomposition: A Self-Supervised Decomposition Approach for Image Fusion | CNN | 无监督 | ECCV | 2022 | Paper | Code |
| SDNet | SDNet: A Versatile Squeeze-and-Decomposition Network for Real-Time Image Fusion | CNN | 无监督 | IJCV | 2021 | Paper | Code |
| PMGI | Rethinking the Image Fusion: A Fast Unified Image Fusion Network based on Proportional Maintenance of Gradient and Intensity | CNN | 无监督 | AAAI | 2020 | Paper | Code |
| IFCNN | IFCNN: A general image fusion framework based on convolutional neural network | CNN | 有监督 | InfFus | 2020 | Paper | Code |
Part 2:常用数据集速查 (Datasets)
以下是图像融合领域主流的公开数据集汇总。为了便于查阅,这里按**应用场景(领域)**进行了统一列表。
| 适用场景 (Domain) | 数据集名称 (Name) | 简介/备注 | 官方/下载链接 (Link) |
|---|---|---|---|
| 红外/可见光图像 | M3SVD | 红外-可见光视频融合数据集 | Download |
| 红外/可见光图像 | TNO | 经典的IVIF数据集 | Download |
| 红外/可见光图像 | INO | 视频分析数据集,包含红外/可见光视频序列 | Download |
| 红外/可见光图像 | RoadScene | 道路交通场景,由FLIR相机拍摄 | Download |
| 红外/可见光图像 | MSRS | 多光谱道路场景,常用于语义分割融合 | Download |
| 红外/可见光图像 | LLVIP | 低光照下的红外-可见光人员检测 | Download |
| 红外/可见光图像 | M3FD | 多模态多场景融合检测数据集 | Download |
| 红外/可见光图像 | FMB | SegMiF 基准数据集,涵盖多种场景 | Download |
| 医学图像 | Harvard | 包含CT/MRI/PET等多种医学模态图谱 | Download |
| 多曝光图像 | MEF | 经典的静态场景多曝光序列 | Download |
| 多曝光图像 | MEFB | 多曝光融合Benchmark,包含复杂场景 | Download |
| 多聚焦图像 | Lytro | 光场相机拍摄的多聚焦图像集 | Download |
| 多聚焦图像 | MFI-WHU | 武汉大学发布的多聚焦图像数据集 | Download |
| 多聚焦图像 | MFFW | 包含不同焦距的现实场景拍摄图像 | Download |
| 遥感影像 | GaoFen | 高分系列卫星影像数据 | Access |
| 遥感影像 | WorldView | NASA WorldView,提供高分辨率地球观测 | Access |
| 遥感影像 | GeoEye | GeoEye-1 卫星影像数据 | Access |
| 遥感影像 | QuickBird | QuickBird 高分辨率商业卫星影像 | Access |
| 视频融合(通用) | VF-Bench | 通用视频融合 Benchmark | Download |
如果你有觉得“必须加入”的经典工作(特别是 2014–2018 年的一些早期深度方法,或者 2025 之后的最新 follow-ups),完全可以在这个表的基础上继续往下扩展。
欢迎在评论区分享你自己的阅读路线和实验心得,让这份“入门清单”变成一个持续更新的社区索引。😊
如需获取文中论文的完整 PDF,可以联系 **2458707789@qq.com ** (备注:姓名-学校 + “PDF获取”),统一打包发送。
&spm=1001.2101.3001.5002&articleId=155458935&d=1&t=3&u=57984d60bb27433d9bc5a32e4e9a9e7a)
1871

被折叠的 条评论
为什么被折叠?



