6、基于深度强化学习的无人机路径规划

基于深度强化学习的无人机路径规划

1. 动作选择策略

传统的贪心方法难以满足无人机路径规划的需求,因此常采用软策略进行动作选择。ε - 贪心动作选择方法如下:执行动作时,以 (1 - ε) 的概率根据 π∗(s) 选择高价值动作;以 ε 的概率随机选择搜索动作空间。其数学表达式为:
[
\pi_{\epsilon}(s) =
\begin{cases}
\pi^*(s), & \text{概率 } 1 - \epsilon \
\text{随机选择 } a \in A, & \text{概率 } \epsilon
\end{cases}
]

2. 改进的 DQN 算法与人工势场结合设计
2.1 网络结构设计

DQN 方法通常会高估行为价值函数的 Q 值,存在过度优化问题。为解决此问题,一般使用两个网络:Q 网络和目标 Q 网络,分别用于行为选择和行为评估。两个网络结构相同,但目标 Q 网络的参数更新速度比在线 Q 网络慢,默认每 300 步更新一次,可根据实际训练需求调整。

为降低学习时间和成本,设计了低复杂度的网络结构,采用 Keras 分层结构构建。为避免过拟合,在全连接层后添加随机失活(Dropout)。最终网络模型由三个全连接层和一个隐藏层组成,以无人机的特征状态作为输入,期望输出 7 个动作的 Q 值,并选择 Q 值最大的动作执行。

2.2 状态空间设计

无人机到周围障碍物的距离是反映其环境状态的最直观指标。利用激光雷达检测无人机与障碍物的相对位置和距离,设计了检测距离信息图。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值