14、深度强化学习:DQN改进与策略梯度方法解析

深度强化学习:DQN改进与策略梯度方法解析

1. DQN与Rainbow在吃豆人游戏中的表现

在吃豆人游戏中,DQN和Rainbow代理都能出色地完成避免幽灵、收集小球以及使用传送门等操作。但总体而言,Rainbow的表现似乎优于DQN。Rainbow已经学会寻找能量球来吃掉幽灵,并且几乎能完成第一关,若给予更多训练时间,它肯定能完成。不过,这两个代理都还未学会吃水果以获得额外分数,或者在吃掉能量球后主动追捕幽灵。

以下是两者表现的简单对比表格:
| 代理 | 避免幽灵 | 收集小球 | 利用传送门 | 寻找能量球 | 完成关卡情况 | 吃水果 | 追捕幽灵 |
| ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- |
| DQN | 能 | 能 | 能 | 未体现 | 未完成 | 未学会 | 未学会 |
| Rainbow | 能 | 能 | 能 | 能 | 接近完成 | 未学会 | 未学会 |

2. DQN的其他改进

“Rainbow DQN”引入了六项对DQN的改进,这些改进主要围绕三个研究主题:
- 神经网络应更快学习并产生更具信息性的结果。
- Q学习应保持稳定且无偏差。
- 强化学习应高效找到最优策略。

在Rainbow DQN中,优先经验回放尝试改进神经网络的学习,双双重Q学习有助于防止Q学习中的最大化偏差,分布强化学习有助于在强化学习中学习更现实的奖励。

2.1 改进探索

ε - 贪婪探索策略常用于随机采样小的有限状态空间,但在复杂环境中,随机扰动代理

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值