从名字上看DDPG是由D(Deep)+D(Deterministic)+PG(Policy Gradient)组成,我们在深度强化学习7——策略梯度(Policy Gradient)已经讲过PG,下面我们将要了解确定性策略梯度(Deterministic Policy Gradient,简称DPG)。
Deterministic Policy Gradient(DPG)
为什么需要确定性策略梯度?主要是因为PG有以下缺点:
- 即使通过PG学习得到了随机策略之后,在每一步行为时,我们还需要对得到的最优策略概率分布进行采样,才能获得action的具体值,而action通常是高维的向量,比如25维、50维,在高维的action空间的频繁采样,无疑是很耗费计算能力。
- 计算梯度需要通过蒙特卡洛采样来进行估算,需要在高维的action空间进行采样,耗费计算能力。
简单来说,对于某一些动作集合来说,它可能是连续值,或者非常高维的离散值,这样动作的空间维度极大。如果我们使用随机策略,即像DQN一样研究它所有的可能动作的概率,并计算各个可能的动作的价值的话,那需要的样本量是非常大才可行的。
所以在2014年,由Deepmind的D.Silver等提出:Deterministic policy gradient algorithms,即作为确定性策略,相同的策略,在同一个状态处,动作是唯一确定的
在这之前,业界普遍认为,环境模型无关(model-free)的确定性策略是不存在的,而D.Silver等通过严密的数学推导,证明了DPG的存在。我们回顾一下策略梯度,基于Q值的梯度计算公式:

本文深入解析深度确定性策略梯度(DDPG)算法,阐述其如何结合深度学习与确定性策略梯度,解决高维连续动作空间的强化学习问题。DDPG通过引入双网络结构、软更新机制及动作噪声,有效提升策略梯度方法的稳定性和效率。
&spm=1001.2101.3001.5002&articleId=103199738&d=1&t=3&u=a2dba297260e4fce8a3d71734e2fa551)
5929

被折叠的 条评论
为什么被折叠?



