基于深度强化学习的无人机路径规划
1. 动作选择策略
传统的贪心方法难以满足无人机路径规划的需求,因此常采用软策略进行动作选择。ε - 贪心动作选择方法如下:执行动作时,以 (1 - ε) 的概率根据 π∗(s) 选择高价值动作;以 ε 的概率随机选择搜索动作空间。其数学表达式为:
[
\pi_{\epsilon}(s) =
\begin{cases}
\pi^*(s), & \text{概率 } 1 - \epsilon \
\text{随机选择 } a \in A, & \text{概率 } \epsilon
\end{cases}
]
2. 改进的 DQN 算法与人工势场结合设计
2.1 网络结构设计
DQN 方法通常会高估行为价值函数的 Q 值,存在过度优化问题。为解决此问题,一般使用两个网络:Q 网络和目标 Q 网络,分别用于行为选择和行为评估。两个网络结构相同,但目标 Q 网络的参数更新速度比在线 Q 网络慢,默认每 300 步更新一次,可根据实际训练需求调整。
为降低学习时间和成本,设计了低复杂度的网络结构,采用 Keras 分层结构构建。为避免过拟合,在全连接层后添加随机失活(Dropout)。最终网络模型由三个全连接层和一个隐藏层组成,以无人机的特征状态作为输入,期望输出 7 个动作的 Q 值,并选择 Q 值最大的动作执行。
2.2 状态空间设计
无人机到周围障碍物的距离是反映其环境状态的最直观指标。利用激光雷达检测无人机与障碍物的相对位置和距离,设计了检测距离信息图。
超级会员免费看
订阅专栏 解锁全文

4147

被折叠的 条评论
为什么被折叠?



