深度基于价值的强化学习:挑战与解决方案
1. 深度强化学习面临的挑战
深度强化学习在实际应用中面临着诸多挑战,主要有以下三个方面:
- 覆盖问题 :Q - 学习等算法收敛到最优策略依赖于对状态空间的完全覆盖,即所有状态 - 动作对都必须被采样。然而,在大型状态空间中,要对所有状态进行采样是不现实的,这就导致算法无法保证收敛到每个状态的最优动作值。
- 相关性问题 :在强化学习中,智能体与环境的交互会产生一系列状态。这些状态往往仅因一个动作而不同,其他特征保持不变,使得后续样本的值具有很强的相关性。这种相关性可能导致有偏训练,训练可能只覆盖状态空间的一部分,增加陷入局部最优的风险,还会降低向最优 Q 函数收敛的速度。例如,一个国际象棋程序在特定开局下训练,当对手采用不同开局时,泛化能力就会变差。
- 收敛问题 :当将深度监督学习方法应用于强化学习时,会遇到自举过程中优化目标本身是自举过程一部分的问题。深度监督学习使用静态数据集来近似函数,损失函数目标稳定;而深度强化学习使用上一个时间步的 Q 更新作为自举目标,该目标在优化过程中会发生变化,导致优化过程容易变得不稳定。
此外,还有一个“致命三角”问题,它由函数近似、自举和离策略学习三个元素组成。函数近似可能会不准确地为状态分配值;自举虽然提高了训练效率,但初始值的误差或偏差可能会持续存在并传播到其他状态;离策略学习使用与优化目标不同的行为策略,收敛效果通常不如在策略学习,且在函数近似的情况下收敛更慢。
2. 实现稳定深度基于价值学习的方法
尽管面临诸多挑战,但研究人员
超级会员免费看
订阅专栏 解锁全文

1733

被折叠的 条评论
为什么被折叠?



