第一章:引言——YOLOv9的时代背景与损失函数的演进
1.1 YOLOv9的诞生与定位
YOLOv9是由YOLOv4和YOLOv7的原作者团队(Chien-Yao Wang等)于2024年2月发布的目标检测框架,是YOLO系列中又一个重要的里程碑。论文标题为《YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information》。与YOLOv5(由Ultralytics团队维护)和YOLOv8(同样由Ultralytics团队维护)不同,YOLOv9由YOLOv4/v7的原班人马打造,继承了YOLOv4的设计理念并进行了深度创新。
YOLOv9的核心目标是解决深度神经网络训练过程中的信息瓶颈和梯度流偏差问题。在实际应用中,例如交通监控系统中的车辆和行人检测,深度网络可能会因为网络层过深而导致在前馈过程中丢失对车辆和行人的关键特征信息。这种信息丢失会导致梯度流在反向传播过程中带有偏差,使得网络无法准确地学习到车辆和行人的特征,进而影响检测准确性。
1.2 YOLOv9的主要创新方向
YOLOv9的技术创新主要集中在以下几个方向:
可编程梯度信息(PGI):一种新的训练框架,用来“给网络喂正确的梯度”。它在训练阶段为主网络(主干分支)注入可靠的监督信号,避免训练过程因为信息丢失而得到错误或不足的梯度。
广义高效层聚合网络(GELAN):一种通用、可扩展、轻量但高表达力的主干/颈部结构,强调参数高利用率与推理效率。
改进的损失函数设计:在YOLOv9中,损失函数采用了多组件设计,包括边框损失(box loss)、目标损失(obj loss)和分类损失(cls loss),并结合Focal Loss
订阅专栏 解锁全文
1万+

被折叠的 条评论
为什么被折叠?



