NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于势场的接触丰富操作强化学习方法

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#algorithm #Machine Learning #optimization

模型无关的强化学习能够通过试错交互获得接触丰富的机器人操作技能,但往往需要策略同时学习任务策略和低层运动生成。此时动作表示尤为关键,因为它决定了策略输出如何转化为机器人运动,从而影响探索和实际执行。直接的笛卡尔指令接口要求策略在每一步都生成运动指令,使任务层适应与连续低层控制耦合,增加学习负担。我们提出 PA‑RL 框架,使用人工势场作为动作表示。策略不直接指令运动,而是调节一个能量类势场的参数,势场根据当前状态产生引导方向,并通过笛卡尔阻抗控制器执行。我们在螺栓插入这一典型的接触丰富任务上进行评估,该任务具有非线性动力学和不连续接触转变。仿真中,PA‑RL 与笛卡尔速度、笛卡尔位姿和可变阻抗动作空间在相同 RL 算法下对比。PA‑RL 是唯一在限定训练时间内达到 100% 成功率的方法,最佳基线仅为 92.6%。相较于最佳基线,PA‑RL 将关节扭矩波动降低 55.4%,笛卡尔加速度波动降低 70.8%,且未在奖励中显式加入运动质量惩罚。仿真训练的策略在真实机器人上直接完成 9/9 次插入,无需微调,展示了潜在场接口的部署可行性。

点评

原文链接: https://arxiv.org/abs/2609.21609

[h] 返回首页