一文详解Diffusion Policy

这是目前机器人控制、具身智能、VLA 落地里最强的动作生成算法之一。


目录

一、一句话说清:Diffusion Policy 是什么?

二、它解决了机器人控制的什么致命问题?

三、超直观理解:扩散模型怎么生成动作?

1)训练阶段:给动作 “加噪声”

2)推理阶段:从噪声 “生成动作”

四、Diffusion Policy 核心结构(机器人专用版)

输入:

输出:

模型结构:

五、为什么 Diffusion Policy 在机器人上这么强?(重点)

1)天生输出平滑轨迹

2)能学习多模态动作分布

3)鲁棒性极强

4)长时序动作生成超强

六、和 ACT 对比(你最关心)

七、最简单的逻辑总结(记这个就够)

八、如果你要落地,我可以继续给你:


一、一句话说清:Diffusion Policy 是什么?

Diffusion Policy = 用扩散模型(Diffusion Model)来生成机器人连续动作序列。

它不是生成图片,而是生成:机器人关节角度 / 末端位姿 / gripper 开合 的平滑轨迹。


二、它解决了机器人控制的什么致命问题?

传统机器人策略(BC、RL、ACT)都有通病:

  1. 动作容易抖动、不平滑
  2. 多模态、多解法的任务学不会(比如一条任务有多种正确姿势)
  3. 一扰动就崩,鲁棒差
  4. 长时序轨迹很难生成

Diffusion Policy 直接把这些问题全部干掉


三、超直观理解:扩散模型怎么生成动作?

扩散模型分两步:加噪(训练) → 去噪(推理)

1)训练阶段:给动作 “加噪声”

  1. 给一段完美的机器人动作轨迹
  2. 一步步加高斯噪声,直到变成纯随机噪声
  3. 让神经网络学习如何把噪声变回干净动作

→ 模型学会:任何噪声 → 还原成正常动作

2)推理阶段:从噪声 “生成动作”

  1. 输入:当前观测(图像 + 关节状态)
  2. 输入:一段纯随机噪声(当作初始动作)
  3. 模型一步步去噪
  4. 最后输出:一段高质量、超平滑的机器人动作序列

四、Diffusion Policy 核心结构(机器人专用版)

输入:

  • 视觉图像(单目 / 多目)
  • 机器人当前状态(关节角)
  • 语言指令(可选)

输出:

未来 N 步动作序列(Action Sequence)例如未来 16/32/64 步关节角度。

模型结构:

  • 视觉编码器(ResNet / ViT)
  • 时序编码器(处理历史观测)
  • 扩散 UNet 或 Transformer(去噪网络)

五、为什么 Diffusion Policy 在机器人上这么强?(重点)

1)天生输出平滑轨迹

扩散模型生成连续分布,动作不会跳变。机器人控制最需要的就是平滑、低抖动

2)能学习多模态动作分布

一个任务可以有多种正确做法:

  • 抓杯子可以左边抓、右边抓
  • 放物体可以有多种姿势

传统模型只会学 “平均动作” → 很烂。扩散模型学完整分布 → 能生成各种正确动作。

3)鲁棒性极强

就算观测有噪声、遮挡、晃动,依然能输出稳定动作。真实机器人环境必备。

4)长时序动作生成超强

一次生成 16~64 步动作,不会像单步策略那样误差累积、漂移、崩溃


六、和 ACT 对比(你最关心)

方法核心思想平滑度多模态鲁棒性难度
ACTTransformer + CVAE + 动作块
Diffusion Policy扩散模型去噪生成动作极高极强极强中高

结论:

  • 高精度、柔顺、复杂操作Diffusion Policy 更强
  • 速度快、轻量 → ACT 更快
  • 现在最顶尖具身智能(如 Google RT-X、DeepMind)都在往 Diffusion Policy

七、最简单的逻辑总结(记这个就够)

  1. 传统策略:预测单点动作
  2. ACT:预测一整段动作块
  3. Diffusion Policy:用扩散模型生成一整段高质量动作轨迹

它是目前机器人连续控制最强范式之一。也是你做 VLA + 实体机器人 + 精细操作 的终极方案。


八、如果你要落地,我可以继续给你:

  • 最精简的 Diffusion Policy 代码(PyTorch)
  • 可直接跑的 扩散策略训练脚本
  • 适配 机械臂 / 轮式机器人 的版本
  • 结合 FSDP / DeepSpeed 分布式训练方案
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

智驱千行

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值