深度强化学习9——Deep Deterministic Policy Gradient(DDPG)

本文深入解析深度确定性策略梯度(DDPG)算法,阐述其如何结合深度学习与确定性策略梯度,解决高维连续动作空间的强化学习问题。DDPG通过引入双网络结构、软更新机制及动作噪声,有效提升策略梯度方法的稳定性和效率。

从名字上看DDPG是由D(Deep)+D(Deterministic)+PG(Policy Gradient)组成,我们在深度强化学习7——策略梯度(Policy Gradient)已经讲过PG,下面我们将要了解确定性策略梯度(Deterministic Policy Gradient,简称DPG)。

Deterministic Policy Gradient(DPG)

为什么需要确定性策略梯度?主要是因为PG有以下缺点:

  1. 即使通过PG学习得到了随机策略之后,在每一步行为时,我们还需要对得到的最优策略概率分布进行采样,才能获得action的具体值,而action通常是高维的向量,比如25维、50维,在高维的action空间的频繁采样,无疑是很耗费计算能力。
  2. 计算梯度需要通过蒙特卡洛采样来进行估算,需要在高维的action空间进行采样,耗费计算能力。

简单来说,对于某一些动作集合来说,它可能是连续值,或者非常高维的离散值,这样动作的空间维度极大。如果我们使用随机策略,即像DQN一样研究它所有的可能动作的概率,并计算各个可能的动作的价值的话,那需要的样本量是非常大才可行的。

所以在2014年,由Deepmind的D.Silver等提出:Deterministic policy gradient algorithms,即作为确定性策略,相同的策略,在同一个状态处,动作是唯一确定的

                                                                                           a_{t}=\mu (s|\theta^{\mu })

在这之前,业界普遍认为,环境模型无关(model-free)的确定性策略是不存在的,而D.Silver等通过严密的数学推导,证明了DPG的存在。我们回顾一下策略梯度,基于Q值的梯度计算公式:

                                                                 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值