当强化学习遇上神经运动科学,一场关于“如何让具身智能像人一样高效、自然地运动”的技术突破正在发生。
01
一个困扰领域多年的核心难题
你有没有想过:人类可以轻松完成羽毛球网前搓球、高速扣杀这类复杂精细的动作,但让机器人或仿真模型复刻同样的技能却难如登天?
核心症结在于人体运动控制系统的超高维度与冗余性。仅上肢就包含数十块肌肉与多关节耦合结构,每一块肌肉都需要在精准时序下激活,才能流畅协调地运动。传统的强化学习(RL)虽然强大,但大多停留在关节角度层面的运动学重构,无法解释中枢神经系统如何实现肌肉级的精细调控。

近日,中国科学院自动化研究所程龙研究员团队在生物医学工程领域顶级期刊《IEEE Transactions on Biomedical Engineering(TBME)》发表重磅研究,为这一难题给出了全新的解决方案。
题目:《Muscle Synergy-Guided Reinforcement Learning for Embodied Musculoskeletal Motion Skill Learning》
作者:Lijun Han,Long Cheng, Muyuan Ma,Feiyang Yang,and Houcheng Li
单位:中国科学院自动化研究所
论文链接:https://ieeexplore.ieee.org/document/1133997
本文提出了一种肌肉协同引导的强化学习(Synergy-Guided RL)框架,旨在解决具身肌肉骨骼模型在学习复杂运动技能时面临的高维度和冗余性挑战。该研究从人体肌电信号提取的肌肉协同生理先验知识融入控制策略,通过结合协同引导控制与残差控制,实现了高效、可解释且类人的运动技能学习。

02
双重控制框架:既守生理规律,又留优化空间
研究团队从人体神经运动控制机制中获得灵感:人类大脑并不会独立控制每一块肌肉,相反,中枢神经系统采用“肌肉协同”(Muscle Synergy)的分层控制策略,将多块肌肉组合为固定的功能协同模块,只需调节少数模块的激活强度,就能生成丰富多样的动作。基于这一原理,团队将人体“肌肉协同”降维控制策略引入强化学习架构,从底层重构了肌肉级控制逻辑。
本项研究的核心创新,在于提出了“肌肉协同引导+残差修正”的双层强化学习控制框架,完美平衡了生理合理性与动作灵活性。一路通过调节离线提取的肌肉协同激活系数,重构符合生理规律的协调肌肉激励,大幅压缩高维动作空间;另一路通过残差控制分量补充精细动作修正能力,在保留生理协调性的同时兼顾轨迹精度。该设计跳出了传统方法“逐肌肉独立控制”的思路,既从本质上降低了学习探索的复杂度,又让控制策略天然具备类人运动的协调特征,为复杂运动技能的快速习得提供了结构化先验。

同时,研究将“最小能耗”这一人体运动核心生理准则嵌入奖励函数,构建“位置+速度+激活惩罚”多维度加权奖励机制,在引导模型复刻专家轨迹的同时,主动约束肌肉过度激活,驱动策略向高效节能的类人运动模式收敛。此外,模型习得的肌肉协同模式与人体真实肌电提取的协同呈现中度相似性(第一分量相关系数达0.92),证明控制策略并非纯数值拟合,而是契合神经运动控制规律,为运动控制模型提供了生理层面的可解释性,也为运动康复、技能评估提供了量化分析依据。
03
实验验证:精度、能效、收敛速度全面超越基线
为全面验证肌肉协同引导框架的精度、效率与鲁棒性,研究团队构建了“数据采集-仿真训练-量化评测”全流程实验体系,以四类羽毛球网前击球动作(正手外搓、正手内搓、反手外搓、反手内搓)为基准任务,结合正手高远球验证长时序动作适配性。

元客视界FZMotion光学动作捕捉系统作为核心运动采集设备,深度参与数据构建与效果评测两大核心环节。

FZMotion提供亚毫米级运动真值,作为模型精度评估基准。实验中,FZMotion光学动捕系统以100Hz采样率,同步采集受试者上肢8个关键解剖标志点的三维运动轨迹,通过硬件触发模块与表面肌电设备实现微秒级时间对齐。系统输出的高精度运动数据经逆运动学解算后,作为强化学习训练的参考轨迹,同时也成为模型生成动作的量化评测标准。

测试结果显示,四类击球任务的平均关节角度RMSE均低于0.015弧度,生成轨迹与参考轨迹皮尔逊相关系数R>0.99,高精度的真值数据为算法效果验证提供了可信的量化依据,确保实验结论的严谨性与可复现性。

相较于纯仿真生成的数据,真实动捕数据的加入显著提升了模型对真实执行误差的适应能力,也为后续控制策略向真实机器人、康复外骨骼迁移奠定了数据基础。

237

被折叠的 条评论
为什么被折叠?



