让我看看,上次挖掘RL的最新发展还是DRL与机械臂结合的研究,
感觉是个新路子!来,咱们把DM+DRL(Diffusion Model & DRL)展开瞅瞅,
Diffusion+DRL 结合的技术路线主要有哪些?
DM+DRL相比RL的优势是,在高维动作空间、稀疏奖励任务等(RL学的慢)场景中,DM负责“想象”可能的行动路径,DRL负责在实际环境中验证和优化路径。
有很多种分类,但我个人喜欢按照论文的发布时间来阐述技术路线演进过程。
策略建模&离线 RL:扩散模型和扩散Q学习(Diffusion-QL)
DM+DRL这个概念初次出现是在2022年8月,出现扩散模型和扩散Q学习(Diffusion-QL),属于策略建模&离线 RL。
Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning
摘要:RL方法在这一场景下往往表现不佳,原因是其对分布外动作的函数近似误差。提出将策略表示为扩散模型:近期涌现的、具有高度表达能力的深度生成模型。本文引入了扩散Q学习(Diffusion-QL),利用条件扩散模型来表示策略。展示了基于扩散模型的策略的表达能力,以及扩散模型下行为克隆与策略改进的耦合,促成扩散Q学习的出色性能。本文方法在大多数D4RL基准任务上能够达到最先进性能。

doi.org/10.48550/arXiv.2208.06193
2023年2月是这篇论文投

与强化学习(DRL)结合有前景吗?有哪些推荐论文?&spm=1001.2101.3001.5002&articleId=154617045&d=1&t=3&u=797b74b8c10c44ceb42d4322dbb88abd)
312

被折叠的 条评论
为什么被折叠?



