深度强化学习:DQN改进与策略梯度方法解析
1. DQN与Rainbow在吃豆人游戏中的表现
在吃豆人游戏中,DQN和Rainbow代理都能出色地完成避免幽灵、收集小球以及使用传送门等操作。但总体而言,Rainbow的表现似乎优于DQN。Rainbow已经学会寻找能量球来吃掉幽灵,并且几乎能完成第一关,若给予更多训练时间,它肯定能完成。不过,这两个代理都还未学会吃水果以获得额外分数,或者在吃掉能量球后主动追捕幽灵。
以下是两者表现的简单对比表格:
| 代理 | 避免幽灵 | 收集小球 | 利用传送门 | 寻找能量球 | 完成关卡情况 | 吃水果 | 追捕幽灵 |
| ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- |
| DQN | 能 | 能 | 能 | 未体现 | 未完成 | 未学会 | 未学会 |
| Rainbow | 能 | 能 | 能 | 能 | 接近完成 | 未学会 | 未学会 |
2. DQN的其他改进
“Rainbow DQN”引入了六项对DQN的改进,这些改进主要围绕三个研究主题:
- 神经网络应更快学习并产生更具信息性的结果。
- Q学习应保持稳定且无偏差。
- 强化学习应高效找到最优策略。
在Rainbow DQN中,优先经验回放尝试改进神经网络的学习,双双重Q学习有助于防止Q学习中的最大化偏差,分布强化学习有助于在强化学习中学习更现实的奖励。
2.1 改进探索
ε - 贪婪探索策略常用于随机采样小的有限状态空间,但在复杂环境中,随机扰动代理
超级会员免费看
订阅专栏 解锁全文
532

被折叠的 条评论
为什么被折叠?



