扩散模型(Diffusion Model)与强化学习(DRL)结合有前景吗?有哪些推荐论文?

让我看看,上次挖掘RL的最新发展还是DRL与机械臂结合的研究,

感觉是个新路子!来,咱们把DM+DRL(Diffusion Model & DRL)展开瞅瞅,

Diffusion+DRL 结合的技术路线主要有哪些?

DM+DRL相比RL的优势是,在高维动作空间、稀疏奖励任务等(RL学的慢)场景中,DM负责“想象”可能的行动路径,DRL负责在实际环境中验证和优化路径。

有很多种分类,但我个人喜欢按照论文的发布时间来阐述技术路线演进过程。

策略建模&离线 RL:扩散模型和扩散Q学习(Diffusion-QL)

DM+DRL这个概念初次出现是在2022年8月,出现扩散模型和扩散Q学习(Diffusion-QL),属于策略建模&离线 RL。

Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning

摘要:RL方法在这一场景下往往表现不佳,原因是其对分布外动作的函数近似误差。提出将策略表示为扩散模型:近期涌现的、具有高度表达能力的深度生成模型。本文引入了扩散Q学习(Diffusion-QL),利用条件扩散模型来表示策略。展示了基于扩散模型的策略的表达能力,以及扩散模型下行为克隆与策略改进的耦合,促成扩散Q学习的出色性能。本文方法在大多数D4RL基准任务上能够达到最先进性能。

doi.org/10.48550/arXiv.2208.06193

2023年2月是这篇论文投

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值