9、强化学习中的关键概念与动态规划方法

强化学习中的关键概念与动态规划方法

1. 强化学习基础与贝尔曼方程

1.1 值函数估计方法

在强化学习中,穷举法会为每个状态单独计算 (V^{\pi}(s)),但实际中可能的轨迹数量巨大甚至无穷。因此,可以采用蒙特卡罗方法,通过随机采样大量轨迹来估计 (V^{\pi}(s))。同时,利用马尔可夫性质可以简化值函数的估计公式,进而引出贝尔曼方程。

1.2 贝尔曼方程

1.2.1 贝尔曼期望方程

贝尔曼方程,也称为贝尔曼期望方程,用于计算在给定策略 (\pi) 下,沿着该策略引导的采样轨迹上值函数的期望,这是一种“基于策略”的方式。
- 对于基于策略的状态 - 值函数 (v^{\pi}(s)),其递归关系推导如下:
[
\begin{align }
v^{\pi}(s) &= E_{a\sim\pi(\cdot|s),s’\sim p(\cdot|s,a)}[R(\tau_{t:T})|S_t = s]\
&= E_{a\sim\pi(\cdot|s),s’\sim p(\cdot|s,a)}[R_t + \gamma R_{t + 1} + \gamma^2 R_{t + 2} +… + \gamma^T R_T|S_t = s]\
&= E_{a\sim\pi(\cdot|s),s’\sim p(\cdot|s,a)}[R_t + \gamma (R_{t + 1} + \gamma R_{t + 2} +… + \gamma^{T - 1} R_T)|S_0 = s]\
&= E_{a\sim\pi(\cdot|s)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值