1. 强化学习基础:从MDP到贝尔曼方程
要理解强化学习(Reinforcement Learning, RL),我们得从它的数学基础——马尔可夫决策过程(Markov Decision Process, MDP)开始。MDP是描述智能体与环境交互的经典数学模型,由五元组(S, A, P, R, γ)构成:
- S:状态集合
- A:动作集合
- P:状态转移概率
- R:奖励函数
- γ:折扣因子
举个生活中的例子,想象你在玩超级玛丽游戏:
- 状态S就是当前游戏画面
- 动作A包括左移、右移、跳跃
- 状态转移P取决于你的操作和游戏规则
- 奖励R来自吃到金币或通关
- 折扣因子γ决定了即时奖励和未来奖励的权重
MDP的核心特性是马尔可夫性——未来状态只依赖于当前状态和动作,与历史无关。这种"无记忆"特性大大简化了问题建模。
贝尔曼方程是MDP的灵魂,它建立了状态价值的递归关系:
V(s) = R(s) + γΣP(s'|s,a)V(s')
这个看似简单的方程蕴含着深刻洞见:一个状态的价值等于即时奖励加上所有可能后续状态的折扣价值期望。我第一次推导这个方程时,那种"aha moment"至今难忘——原来复杂的序列决策问题可以如此优雅地分解。
2. 经典求解方法:DP、MC与TD的对比
2.1 动态规划(DP):基于模型的完美求解
动态规划是解决MDP的经典方法,它要求完全知道环境模型(P和R)。DP的核心思想是"分而治之",通过价值迭代或策略迭代逐步优化。
我在实际项目中用过价值迭代,它的伪代码很简单:
- 初始化所有V(s)=0
- 重复直到收敛: V(s) ← max_a[R(s,a) + γΣP(s'|s,a)V(s')]
但DP有两个致命缺点:
- 需要完整环境模型


480

被折叠的 条评论
为什么被折叠?



