这是目前机器人控制、具身智能、VLA 落地里最强的动作生成算法之一。
目录
四、Diffusion Policy 核心结构(机器人专用版)
五、为什么 Diffusion Policy 在机器人上这么强?(重点)
一、一句话说清:Diffusion Policy 是什么?
Diffusion Policy = 用扩散模型(Diffusion Model)来生成机器人连续动作序列。
它不是生成图片,而是生成:机器人关节角度 / 末端位姿 / gripper 开合 的平滑轨迹。
二、它解决了机器人控制的什么致命问题?
传统机器人策略(BC、RL、ACT)都有通病:
- 动作容易抖动、不平滑
- 多模态、多解法的任务学不会(比如一条任务有多种正确姿势)
- 一扰动就崩,鲁棒差
- 长时序轨迹很难生成
Diffusion Policy 直接把这些问题全部干掉。
三、超直观理解:扩散模型怎么生成动作?
扩散模型分两步:加噪(训练) → 去噪(推理)
1)训练阶段:给动作 “加噪声”
- 给一段完美的机器人动作轨迹
- 一步步加高斯噪声,直到变成纯随机噪声
- 让神经网络学习如何把噪声变回干净动作
→ 模型学会:任何噪声 → 还原成正常动作
2)推理阶段:从噪声 “生成动作”
- 输入:当前观测(图像 + 关节状态)
- 输入:一段纯随机噪声(当作初始动作)
- 模型一步步去噪
- 最后输出:一段高质量、超平滑的机器人动作序列
四、Diffusion Policy 核心结构(机器人专用版)
输入:
- 视觉图像(单目 / 多目)
- 机器人当前状态(关节角)
- 语言指令(可选)
输出:
未来 N 步动作序列(Action Sequence)例如未来 16/32/64 步关节角度。
模型结构:
- 视觉编码器(ResNet / ViT)
- 时序编码器(处理历史观测)
- 扩散 UNet 或 Transformer(去噪网络)
五、为什么 Diffusion Policy 在机器人上这么强?(重点)
1)天生输出平滑轨迹
扩散模型生成连续分布,动作不会跳变。机器人控制最需要的就是平滑、低抖动。
2)能学习多模态动作分布
一个任务可以有多种正确做法:
- 抓杯子可以左边抓、右边抓
- 放物体可以有多种姿势
传统模型只会学 “平均动作” → 很烂。扩散模型学完整分布 → 能生成各种正确动作。
3)鲁棒性极强
就算观测有噪声、遮挡、晃动,依然能输出稳定动作。真实机器人环境必备。
4)长时序动作生成超强
一次生成 16~64 步动作,不会像单步策略那样误差累积、漂移、崩溃。
六、和 ACT 对比(你最关心)
| 方法 | 核心思想 | 平滑度 | 多模态 | 鲁棒性 | 难度 |
|---|---|---|---|---|---|
| ACT | Transformer + CVAE + 动作块 | 高 | 中 | 中 | 中 |
| Diffusion Policy | 扩散模型去噪生成动作 | 极高 | 极强 | 极强 | 中高 |
结论:
- 要高精度、柔顺、复杂操作 → Diffusion Policy 更强
- 要速度快、轻量 → ACT 更快
- 现在最顶尖具身智能(如 Google RT-X、DeepMind)都在往 Diffusion Policy 靠
七、最简单的逻辑总结(记这个就够)
- 传统策略:预测单点动作
- ACT:预测一整段动作块
- Diffusion Policy:用扩散模型生成一整段高质量动作轨迹
它是目前机器人连续控制最强范式之一。也是你做 VLA + 实体机器人 + 精细操作 的终极方案。
八、如果你要落地,我可以继续给你:
- 最精简的 Diffusion Policy 代码(PyTorch)
- 可直接跑的 扩散策略训练脚本
- 适配 机械臂 / 轮式机器人 的版本
- 结合 FSDP / DeepSpeed 分布式训练方案

6146

被折叠的 条评论
为什么被折叠?



