强化学习中的关键概念与动态规划方法
1. 强化学习基础与贝尔曼方程
1.1 值函数估计方法
在强化学习中,穷举法会为每个状态单独计算 (V^{\pi}(s)),但实际中可能的轨迹数量巨大甚至无穷。因此,可以采用蒙特卡罗方法,通过随机采样大量轨迹来估计 (V^{\pi}(s))。同时,利用马尔可夫性质可以简化值函数的估计公式,进而引出贝尔曼方程。
1.2 贝尔曼方程
1.2.1 贝尔曼期望方程
贝尔曼方程,也称为贝尔曼期望方程,用于计算在给定策略 (\pi) 下,沿着该策略引导的采样轨迹上值函数的期望,这是一种“基于策略”的方式。
- 对于基于策略的状态 - 值函数 (v^{\pi}(s)),其递归关系推导如下:
[
\begin{align }
v^{\pi}(s) &= E_{a\sim\pi(\cdot|s),s’\sim p(\cdot|s,a)}[R(\tau_{t:T})|S_t = s]\
&= E_{a\sim\pi(\cdot|s),s’\sim p(\cdot|s,a)}[R_t + \gamma R_{t + 1} + \gamma^2 R_{t + 2} +… + \gamma^T R_T|S_t = s]\
&= E_{a\sim\pi(\cdot|s),s’\sim p(\cdot|s,a)}[R_t + \gamma (R_{t + 1} + \gamma R_{t + 2} +… + \gamma^{T - 1} R_T)|S_0 = s]\
&= E_{a\sim\pi(\cdot|s)
超级会员免费看
订阅专栏 解锁全文

1204

被折叠的 条评论
为什么被折叠?



