Markov Decision Process(MDP)
Markov Property:Just depend on current status
Markov Process/Markov Chain state transition matrix P :p(st+1=s′∣st=s)p(s_{t+1}=s'|s_t=s)p(st+1=s′∣st=s)
从一个节点到另一个节点的概率
Markov Reward Process(MRP):add reward weights
Horizon:steps in each episode
Return:discount(avoid cyclic避免无穷奖励,在近期得到奖励)
value function
Markov Reward Process
Bellman equation:V(s)=R(s)+γ∑s′∈SP(s′∣s)V(s′)V(s)=R(s)+\gamma\sum_{s'\in S}P(s'|s)V(s')V(s)=R(s)+γ∑s′∈SP(s′∣s)V(s′)

求解矩阵的复杂度过大,适用于小数据
一次轨迹一次采样,用于计算相应的Vt(s)V_t(s)Vt(s)
value matrix计算方法:
(1)Monte Carlo Algorithm
(2)动态规划Bellman equation变成 bellman update (迭代计算)
Markov Decision Process
增加决策过程
P(st+1=s′∣st=s,at=a),atP(s_{t+1}=s'|s_t=s,a_t=a),a_tP(st+1=s′∣st=s,at=a),at表示当前采取的行为
相应的policy:
π(a∣s)=P(at∣st)\pi(a|s)=P(a_t|s_t)π(a∣s)=P(at∣st)
已知一个Markov奖励过程与policy π\piπ,则可以把马尔可夫决策过程转化为马尔可夫奖励过程。
Compare MP/MRP & MDP
在当前状态到下一个状态中加上了由agent控制的过程(依赖于policy的选取)
从而可以对MDP计算一个价值函数:对policy(t时刻采取各种行为对应的随机变量)求一个期望。
def:action-value function qπ(s,a)=Eπ[Gt∣st=s,At=a]q^\pi(s,a)=E_\pi[G_t|s_t=s,A_t=a]qπ(s,a)=Eπ[Gt∣st=s,At=a]
relation:vπ(s)=∑a∈Aπ(a∣s)qπ(s,a)v^{\pi}(s)=\sum_{a\in A}\pi(a|s)q^\pi(s,a)vπ(s)=∑a∈Aπ(a∣s)qπ(s,a)
Prediction & Control in MDP
Prediction:evaluate a given policy
Control:(search the optimal policy)
Dynamic Programming
Prediction:
给定policy function,简化成Markov Reward process
synchronous backup递归求vπ(s)v_{\pi}(s)vπ(s),此时给定policy的价值函数,递归过程是vt(s)=f(vt+1(s))v_t(s)=f(v_{t+1}(s))vt(s)=f(vt+1(s))收敛到vπ(s)v^\pi(s)vπ(s)
vt+1(s)=Rπ(s)+γPπ(s′∣s)vt(s′)v_{t+1}(s)=R^\pi(s)+\gamma P^\pi(s'|s)v_t(s')vt+1(s)=Rπ(s)+γPπ(s′∣s)vt(s′)
默认:价值函数只与状态有关
Optimal Value Function:
v∗(s)=maxπ vπ(s)v^*(s)=\underset{\pi}{max}\,v^{\pi}(s)v∗(s)=πmaxvπ(s)
π∗(s)=arg maxv∗ π(s)\pi^*(s)=\underset{v^*}{arg\,max}\,\pi(s)π∗(s)=v∗argmaxπ(s)
Find optimal policy:
1.Policy search(穷举)
2.MDP control,在infinte horizon情况下optimal policy 是deterministic
迭代过程:计算policy π\piπ,improve policy π′=greedy(vπ)\pi'=greedy(v^\pi)π′=greedy(vπ)
即policy与value之间进行循环迭代

这样的操作保证效果↑\uparrow↑
Bellman optimality equation:v∗(s)=maxaq∗(s,a)v^*(s)=max_aq^*(s,a)v∗(s)=maxaq∗(s,a)
Value Iterate 对Bellman Optimality Equation 做迭代找到最佳策略
通过每一个状态迭代
man optimality equation:v∗(s)=maxaq∗(s,a)v^*(s)=max_aq^*(s,a)v∗(s)=maxaq∗(s,a)
Value Iterate 对Bellman Optimality Equation 做迭代找到最佳策略
通过每一个状态迭代

本文深入探讨了马尔科夫决策过程(MDP)、马尔可夫奖励过程(MRP)及其在强化学习中的应用。介绍了贝尔曼方程、价值函数、最优价值函数以及动态规划在MDP中的预测与控制策略。强调了价值迭代和策略迭代在寻找最优策略中的作用,并阐述了MDP如何通过agent的决策过程来优化状态转移。

4538

被折叠的 条评论
为什么被折叠?



