【无标题】

基于约束采样与强化学习的机器人非抓取操作研究

在机器人领域,接触丰富场景下的非抓取操作一直是颇具挑战的研究方向。非抓取操作依靠机器人和环境、物体之间建立接触来完成任务,并不依赖夹持器夹紧物体。传统强化学习虽然适配接触类任务,但容易遭遇探索不足的问题,很难发掘复杂的物体交互策略。这篇论文提出 CSRL 方法,结合约束采样与强化学习,面向通用非抓取操作策略开展训练研究。

物理仿真器负责对动力学进行采样,与之互补,我们采用基于物理原理的状态采样器,对初始状态与目标状态进行全局采样。状态约束考虑了接触的结构特征,能够覆盖多种不同的接触模式。(b) 约束采样得到的示例样本。

该方法的核心思路是:利用一个物理信息驱动的约束状态采样器来生成多样化的起始状态和目标状态分布,以此作为强化学习的重置策略,从而缓解探索难题。与传统方法依赖随机场景生成或抓取专用采样器不同,CSRL通过显式建模接触模式——包括碰撞约束、接触力、库仑摩擦锥以及准静态平衡条件——来系统性地覆盖多种接触配置。

基于约束采样与强化学习的机器人非抓取操作研究

在此基础上,研究团队进一步引入了投影插值重置和课程学习策略:通过在约束空间中插值起始状态与目标状态,并随着训练进程逐步增大插值范围,使得策略能够从较容易的子任务开始学习,逐步过渡到更复杂的操作场景。

Franka Research 3(Panda)机器人在项目中的应用

Franka Research 3 机器人是本次实验重要的硬件与仿真载体,承担仿真验证与实物迁移测试两项关键工作。

仿真域验证全身接触操作能力 研究搭建 pandasphere、pandacube 两个仿真环境,将 Franka 机器人作为执行主体。仿真中机器人连杆、夹爪都可以参与接触交互,测试依靠全身接触完成推移、托举、调姿的非抓取技能。实验对比证明,借助约束采样的重置策略,机器人可以学习到利用多肢体接触托持球体、调整立方体姿态的行为,完成依靠边缘、角点支撑物体这类难度较高的静态目标。对比随机重置基线,约束采样搭配插值课程策略,能够明显提升任务成功率。

实现仿真策略向真实世界迁移验证 为检验仿真训练策略的落地潜力,研究在真实 Franka Research3 机械臂末端加装球形执行端,搭配 OptiTrack 动捕系统获取立方体物体位姿。仿真学习得到的球体立方体交互策略,借助逆运动学映射到真实机械臂,完成实物推挤操作实验。该验证没有直接解决视觉输入等感知问题,仅验证基于完整状态的操作技能具备一定的迁移可能性,为后续感知操作结合的研究提供参考。

Franka(FR3)具身智能优势

Franka Research 3本身是针对人工智能与机器人研究设计的力敏感型机器人系统,具备7个自由度、±0.1毫米的位置重复精度、3公斤有效载荷和855毫米工作半径。这些技术特性使其成为操作学习研究的常用平台。在本项目之外,FR3已被广泛用于模仿学习、双臂操作、触觉插入等多种机器人操作研究场景中。

总结

CSRL方法通过将约束采样与强化学习相结合,为非抓取式操作策略的训练提供了一种新的思路。在这一工作中,Franka Research 3作为仿真环境中的操作主体和真实迁移实验的平台,为方法的验证提供了支撑。该研究也表明,在接触丰富的操作任务中,重置分布的设计与强化学习算法本身同等重要——而像FR3这样具备精确运动控制和力感知能力的平台,为这类方法的实验验证创造了条件。

项目详情:https://www.user.tu-berlin.de/mtoussai/26-CSRL/

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值