神经科学中的强化学习:TD误差与多巴胺对应关系及神经演员 - 评论家算法
1. 多巴胺神经元与TD误差的初步关联
研究发现猴子会在内部记录奖励的时间,多巴胺神经元对未预测到的奖励、奖励的最早预测因子有反应。若奖励或奖励预测因子未在预期时间出现,多巴胺神经元活动会降至基线以下。熟悉强化学习的研究人员很快发现,这些结果与TD算法中TD误差作为强化信号的行为惊人相似。
2. TD误差与多巴胺对应关系的详细分析
- 任务设定与假设
- 假设智能体已学会获取奖励所需的动作,其任务是为所经历的状态序列学习准确的未来奖励预测,这是一个策略评估任务,即学习固定策略的价值函数。
- 智能体的经验分为多个试验,每个试验中相同的状态序列重复出现,每次试验中的每个时间步都有一个不同的状态。预测的回报仅限于一次试验内的回报,一次试验相当于强化学习中的一个情节。
- 采用Montague等人(1996)使用的CSC表示法,每个试验的每个时间步访问的每个状态都有一个单独的内部刺激。智能体使用TD(0)学习存储在查找表中的价值函数V,初始值都设为零,且假设这是一个确定性任务,折扣因子γ接近1可忽略。
-
学习过程中的TD误差变化
- 学习初期 :在第一次试验中,除到达奖励状态时奖励信号为正(设为R?)外,整个试验过程中奖励信号为零,且所有V值都为零,所以TD误差也为零,直到到达奖励状态时变为R?。这类似于训练开始时多巴
超级会员免费看
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



