论文题目:FBRT-YOLO: Faster and Better for Real-Time Aerial Image Detection(更快更好的实时航空图像检测)
会议:AAAI2025
摘要:具有视觉功能的嵌入式飞行设备已成为广泛应用的必要条件。在航空图像检测中,虽然现有的许多方法已经部分解决了小目标检测问题,但如何优化小目标检测,平衡检测精度和效率仍然存在挑战。这些问题是实时航空图像检测技术发展的主要障碍。本文提出了一种新的用于航空图像检测的实时探测器系列,称为FBRT-YOLO,以解决检测精度和效率之间的不平衡问题。该方法包括两个轻量级模块:特征互补映射模块(Feature Complementary Mapping Module, FCM)和多核感知单元(Multi-Kernel Perception Unit, MKP),旨在增强航拍图像中小目标的物体感知能力。FCM侧重于缓解深度网络中由于小目标信息丢失而导致的信息不平衡问题。它旨在将目标的空间位置信息更深入地整合到网络中,更好地与更深层的语义信息对齐,以提高小目标的定位。我们引入了MKP,它利用不同大小核的卷积来增强不同尺度目标之间的关系,提高不同尺度目标的感知能力。在Visdrone、UAVDT和AI-TOD三种主要航空图像数据集上进行的大量实验结果表明,FBRT-YOLO在性能和速度方面优于各种实时检测器。
代码- https://github.com/galaxy-oss/FCM。

FBRT-YOLO——让航空图像检测更快更好
引言
在无人机、航拍等应用场景中,实时准确地检测图像中的目标是一项极具挑战性的任务。目标往往很小,背景复杂,而且需要在资源受限的嵌入式设备上运行。今天,我将为大家详细介绍一篇发表在AAAI 2025上的优秀论文:FBRT-YOLO: Faster and Better for Real-Time Aerial Image Detection。这项工作来自北京理工大学,提出了一个专门针对航空图像检测优化的实时检测器家族。

Fig.1: 之前的方法在特征提取时忽略了骨干网更深层空间信息的嵌入,导致空间语义不一致。我们的方法旨在在特征提取过程中将浅层空间位置信息传递到网络的更深层,从而增强语义信息的表达。
一、航空图像检测面临的挑战
1.1 小目标检测的困境
想象一下,当无人机在300米高空俯瞰地面时,一辆汽车在图像中可能只有几个像素大小。这就是航空图像检测的第一大难题:小目标检测。
论文指出,航空图像中的目标具有以下特点:
- 尺寸小:目标在图像中占据的像素极少
- 易遮挡:经常被复杂背景干扰
- 信息丢失:在深度神经网络的多层下采样过程中,小目标的特征容易消失
1.2 准确率与速度的两难
虽然提高图像分辨率可以改善小目标检测效果,但这会带来巨大的计算负担。对于需要实时响应的无人机来说,这是不可接受的。因此,如何在保证检测准确率的同时实现实时性能,成为亟待解决的问题。
1.3 特征不匹配问题
深度神经网络的一个核心问题是:浅层网络具有高分辨率的空间信息,但语义信息较弱;深层网络语义信息丰富,但空间分辨率低。这种不匹配导致小目标的位置信息在网络深层难以准确保留。
二、FBRT-YOLO的创新设计
为了解决上述问题,研究团队提出了FBRT-YOLO,其核心是两个精心设计的轻量级模块。
2.1 整体架构

从Figure 3可以看到,FBRT-YOLO的整体架构包括:
- Backbone:特征提取主干网络
- Neck:特征融合网络
- Head:检测头
关键创新在于:
- 在Backbone的每个阶段嵌入FCM模块
- 在第四阶段引入MKP单元替代最后的下采样层
- 相应减少检测头的数量
2.2 Feature Complementary Mapping Module (FCM)
FCM模块是论文的第一个核心创新,它的设计思想非常巧妙。

工作原理
第一步:通道分割(Channel Split)
将输入特征X分为两部分:
- X¹:占比α的通道
- X²:占比(1-α)的通道
论文发现,随着网络加深,增加保留空间信息的分支比例能显著提升性能。实验表明,在前两个阶段使用α=0.75,后两个阶段使用α=0.25的配置最优。
第二步:方向转换(Orientation Transformation)
- X¹分支:通过3×3标准卷积,提取丰富的通道信息(记为X^C)
- X²分支:通过1×1逐点卷积,保留浅层空间位置信息(记为X^S)
这种设计确保了两个分支各司其职:一个专注语义,一个专注空间。
第三步:互补映射(Complementary Mapping)
这是FCM最精彩的部分!
通道交互(Channel Guidance):
- 使用深度卷积(DWConv)对每个通道独立处理
- 全局平均池化提取每个通道的全局信息
- 通过Sigmoid层生成通道权重ω₁
- 将ω₁映射到空间信息分支X^S
空间交互(Spatial Aggregation):
- 通过1×1卷积、BN和Sigmoid生成空间权重ω₂
- 将ω₂映射到通道信息分支X^C
第四步:特征聚合(Feature Aggregation)
最终输出:
X^FCM = (X^C ⊗ ω₂) ⊕ (X^S ⊗ ω₁)
这样,输出特征同时包含了空间和语义的双重映射关系。

从Table 6可以看到:
- 无映射:AP 25.0%
- 仅通道映射:AP 25.6%
- 仅空间映射:AP 25.3%
- 双重映射:AP 25.9%(提升2.0%)
为什么FCM有效?
FCM的精妙之处在于:
- 信息互补:让强特征指导弱特征
- 轻量高效:计算开销小
- 层次传递:将浅层空间信息传递到深层
2.3 Multi-Kernel Perception Unit (MKP)
MKP是论文的第二个核心创新,专注于多尺度感知。

设计动机
航空图像中的目标尺度变化很大:
- 近处的车辆可能较大
- 远处的行人可能只有几个像素
单一尺度的卷积核难以同时捕获这些不同尺度的信息。
工作原理
MKP采用串联式多核设计:
X' = T₇(A(T₅(A(T₃(X)))))
其中:
- T₃, T₅, T₇分别表示3×3, 5×5, 7×7的深度卷积
- A表示逐点卷积转换
- 在不同尺度卷积之间插入点卷积以整合空间信息
从可视化结果可以看到,不同尺寸的卷积核关注的区域不同:
- 小核(3×3):关注细节
- 中核(5×5):平衡全局和局部
- 大核(7×7):捕获更广的上下文
消融实验验证

从Table 8的结果:
- 单一小核(3,3,3):AP 25.4%,参数2.82M
- 单一大核(7,7,7):AP 25.8%,参数2.94M
- 多核组合(3,5,7):AP 25.9%,参数2.90M
多核组合实现了最佳的性能-参数平衡!
MKP的双重作用
- 增强多尺度感知:同时捕获不同尺度的特征
- 简化网络结构:替代最后的下采样层,减少一个检测头
2.4 针对性的网络优化
除了两个核心模块,论文还对网络进行了细致的冗余减少。
优化策略
传统方法:先通道扩展,再空间下采样
通道扩展 → 深度卷积下采样
FBRT-YOLO方法:先空间下采样,再通道扩展
组卷积下采样 → 点卷积通道扩展
参数对比
- 标准方法:P' = 3×3×C₁×C₂
- 优化方法:P = 3×3×C₁×(C₁/g) + 1×1×C₁×C₂
当C₂=2C₁时(通常的下采样场景),优化方法显著减少参数量。

从Table 5:
- Baseline:AP 23.6%,参数11.2M
- 仅RR:AP 23.4%,参数9.1M(减少18%)
虽然AP略降,但这为后续模块腾出了计算空间。
三、实验结果:全面超越SOTA
3.1 VisDrone数据集:主战场
VisDrone是航空图像检测最权威的基准之一,包含大量不同场景的无人机航拍图像。

Figure 2非常直观地展示了FBRT-YOLO的优势:
- 横轴:参数量(Parameter)
- 纵轴:AP50准确率
- 圆圈大小:GFLOPs(计算量)
可以清楚地看到,FBRT-YOLO系列(红色圆圈)在相同参数量下达到了更高的准确率!
详细性能对比

FBRT-YOLO-X是所有模型中准确率最高的,同时保持了最优的效率!
与专门方法的对比

虽然FBRT-YOLO的AP50略低于某些方法,但在AP和AP75上都是最优的,说明其检测更加精确。
可视化结果

Figure 4展示了非常令人信服的对比:
第一行场景(城市道路):
- GT:真实标注
- Baseline热力图:关注区域分散
- FBRT-YOLO热力图:更集中在小目标上
- Baseline结果:漏检较多
- FBRT-YOLO结果:检测更全面
第二行场景(停车场):
- FBRT-YOLO对密集小目标的检测明显优于Baseline
- 热力图显示FBRT-YOLO更好地聚焦在目标区域
3.2 UAVDT数据集:低光照挑战
UAVDT包含大量低光照和复杂背景的场景,是对检测器鲁棒性的严峻考验。

FBRT-YOLO在所有指标上都达到了最优!

Figure 5展示了三个极具挑战的场景:
场景1(低光照道路):
- Baseline(蓝框):多个漏检
- FBRT-YOLO(红框):准确检出所有车辆
场景2(复杂停车场):
- 背景相似度高
- FBRT-YOLO仍能准确区分目标和背景
场景3(雾天环境):
- 可见度极低
- FBRT-YOLO的鲁棒性优势明显
特征图对比显示,FBRT-YOLO在复杂条件下仍能提取清晰的目标特征。
3.3 AI-TOD数据集:极小目标
AI-TOD专注于极小目标检测,是对模型小目标处理能力的终极考验。

在极小目标场景下:
- AP提升1.1%
- AP50提升2.2%
- 参数减少74%
- FPS提升8.4%
这证明了FCM和MKP模块对小目标的特殊优势!
四、深入探索:消融实验
为了验证每个组件的有效性,论文进行了细致的消融实验。
4.1 核心组件的贡献
| 配置 | RR | FCM | MKP | AP | AP50 | 参数 | GFLOPs |
|---|---|---|---|---|---|---|---|
| Baseline | ✗ | ✗ | ✗ | 23.6% | 39.6% | 11.2M | 28.6G |
| +RR | ✓ | ✗ | ✗ | 23.4% | 39.2% | 9.1M | 25.5G |
| +RR+FCM | ✓ | ✓ | ✗ | 24.3% | 40.6% | 7.2M | 23.2G |
| Full | ✓ | ✓ | ✓ | 25.9% | 42.4% | 2.9M | 22.9G |
逐步分析:
第一步:冗余减少(RR)
- AP略降0.2%(23.6%→23.4%)
- 但参数减少18%(11.2M→9.1M)
- GFLOPs减少11%(28.6G→25.5G)
- 为后续模块创造空间
第二步:加入FCM
- AP显著提升0.9%(23.4%→24.3%)
- AP50提升1.4%(39.2%→40.6%)
- 参数进一步减少到7.2M
- 验证了空间-语义融合的有效性
第三步:加入MKP
- AP大幅提升1.6%(24.3%→25.9%)
- AP50提升1.8%(40.6%→42.4%)
- 参数减少到2.9M(相比Baseline减少74%)
- GFLOPs仅22.9G
- 实现了准确率和效率的完美平衡
4.2 FCM的分割比例α

关键发现:
- 前两阶段α=0.75(更多通道信息)
- 后两阶段α=0.25(更多空间信息)
- 这种渐进式设计最优
解释:随着网络加深,保留更多空间信息有助于小目标定位!
4.3 MKP的卷积核配置

分析:
- 小核(3,3,3):感受野不足,上下文信息有限
- 大核(7,7,7):引入过多背景噪声
- 多核组合(3,5,7):兼顾不同尺度,达到最佳平衡
五、技术亮点总结
5.1 创新性
-
FCM的互补映射机制
- 首次提出空间-通道互补映射
- 轻量级设计,易于集成
- 显著改善小目标特征表达
-
MKP的多尺度感知
- 串联式多核设计
- 同时替代下采样层
- 一举两得:提升性能+简化结构
-
针对性网络优化
- 解耦下采样和通道扩展
- 减少冗余计算
- 为航空图像量身定制
5.2 实用性
性能指标:
- VisDrone AP 30.1%(SOTA)
- UAVDT AP 18.4%(SOTA)
- AI-TOD AP 20.2%(小目标优势明显)
效率指标:
- 最小模型0.9M参数,192 FPS
- 最大模型22.8M参数,52 FPS
- 全面适配不同硬件平台
泛化能力:
- 三个数据集上全面领先
- 不同场景(城市、郊区、复杂背景)都表现优异
- 不同条件(正常、低光照、雾天)都保持鲁棒
5.3 工程价值
-
易于部署
- 轻量级设计
- 无需额外训练技巧
- 标准YOLO框架,易于理解和修改
-
可扩展性
- 提供N/S/M/L/X多个规模
- 可根据硬件资源灵活选择
- FCM和MKP可独立使用
-
开源代码
- 作者已开源:https://github.com/galaxy-oss/FCM
- 方便研究者复现和改进
六、未来展望
虽然FBRT-YOLO已经取得了优异的成绩,但仍有一些值得探索的方向:
-
更极端的轻量化
- 探索神经架构搜索(NAS)
- 结合知识蒸馏
- 量化感知训练
-
更复杂的场景
- 夜间检测
- 极端天气
- 运动模糊
-
多任务学习
- 同时进行检测、跟踪、分割
- 端到端的感知系统
-
特定领域优化
- 交通监控
- 农业巡检
- 搜救应用
结语
FBRT-YOLO为航空图像实时检测提供了一个优雅而高效的解决方案。通过FCM模块的空间-语义互补映射和MKP模块的多尺度感知,它在三个权威数据集上都实现了SOTA性能,同时保持了出色的实时性。
核心价值:
- ✅ 更准确:AP提升1.2-2.3%
- ✅ 更快速:FPS提升10-20%
- ✅ 更轻量:参数减少66-74%
- ✅ 更鲁棒:多场景适应能力强
对于无人机、航拍、交通监控等实际应用,FBRT-YOLO无疑是一个非常有价值的选择。如果你正在从事相关领域的研究或开发,强烈推荐尝试这个方法!
希望这篇博客能帮助你深入理解FBRT-YOLO的设计思想和技术细节。如有任何问题,欢迎讨论交流!
FBRT-YOLO: 更快更好的实时航空图像检测&spm=1001.2101.3001.5002&articleId=157067964&d=1&t=3&u=0d737217df0f412dad5dc5279d35798c)
642

被折叠的 条评论
为什么被折叠?



