RL策略梯度方法之(十八): Importance Weighted Actor-Learner Architecture (IMPALA)

IMPALA(Imitation Learning, Policy Gradients, and Actor-Learner Architectures)是一种分布式深度强化学习算法,通过将actor与learner分离,提高学习效率。与A3C不同,IMPALA的actor仅收集经验,learner负责计算梯度。为解决策略滞后问题,文章介绍了V-trace离策略优势算法,用于修正actor的off-policy样本。V-trace确保了价值函数的收敛,并在多任务和大规模环境中展现出高数据效率和线性扩展性。

本专栏按照 https://lilianweng.github.io/lil-log/2018/04/08/policy-gradient-algorithms.html 顺序进行总结 。



基于重要性采样的分布式深度强化学习算法

S V P G \color{red}SVPG SVPG :[ paper:Stein Variational Policy Gradient | code ]


原理解析

以下总结来源于https://blog.csdn.net/yH0VLDe8VG8ep9VGe/article/details/79292530

IMPALA的灵感来自于热门的A3C架构,后者使用多个分布式actor来学习agent的参数。在类似这样的模型中,每个actor都使用策略参数的一个副本,在环境中操作actor会周期性地暂停探索,将它们已经计算得出的梯度信息分享至中央参数服务器,而后者会对此进行更新。

在这里插入图片描述
与此不同,IMPALA中的actor不会被用来计算梯度信息。它们只是收集经验,并将这些经验传递至位于中心的learnerlearner计算梯度。因此在这样的模型中,actor 和 learner 是完全独立的。为了利用当代计算系统的规模优势,IMPALA在配置中可支持单个learner机器也可支持多个相互之间同步的learner机器。以这种方式将学习和操作分开也有利于提升整个系统的吞吐量,因为与批量A2C这类架构不同,actor不再需要等待学习步骤。这帮助我们在有趣的环境中训练IMPALA,同时不必面临由于帧渲染时间或任务重启耗时造成的差异。

在这里插入图片描述
不过操作和学习的解耦也导致,actor的策略落后于learner。为了弥补这样的差距,我们引入了离策略优势actor-评价者公式V-trace。它弥补了离策略actor获得的轨迹。你可以从我们的论文中了解算法及其分析细节。
在这里插入图片描述
凭借优化的模型,与传统agent相比,IMPALA可以处理多出一到两个数量级的经验,使得在挑战性环境中的学习成为可能。我们将IMPALA与多种热门的actor-评价者方法进行了比较,发现前者有明显的速度提升。此外,IMPALA的吞吐量上升与actor、learner的数量增长呈线性关系。这表明,分布式agent模型和V-trace算法都可以胜任超大规模的实验,即使机器数量达到数千台。

在利用DMLab-30关卡进行测试时,与分布式A3C相比,IMPALA的数据效率达到10倍,而最终得分达到两倍。此外,与单任务环境中的训练相比,IMPALA在多任务环境的训练中表现出正向转换。

以下总结来源于:https://zhuanlan.zhihu.com/p/58226117?utm_source=wechat_session

在这里插入图片描述
Single Learner

learner 的主要作用是通过获取 actor 得到的轨迹来做 SGD 来更新各个神经网络的参数,神经网络训练本身可并行的特性,learner 使用的是一块GPU。actor 定期从 learner 获取最新的神经网络参数,并且每个 actor 起一个模拟环境,来使用自己能获得的最新策略去采样,并且把获取到的 { x t , a t , r t , μ ( a t ∣ x t ) } \{ x_t, a_t, r_t, \mu(a_t|x_t)\} { xt,at,rt,μ(atx<

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值