层次化机器人系统在执行长时序操作任务时,需要在高层做语义决策来调度随机的低层技能。此时,失败的 rollout 往往是模糊的:下游状态不佳可能来源于高层决策错误、观测不完整,或是决策本身正确但执行失败。传统的监督学习缺少这类恢复状态的数据,强化学习又受稀疏奖励和非局部信用分配的限制。
为此我们提出 MAGMA‑GEN,一个基于 on‑policy 的数据生成管线,能够把模糊的失败 rollout 转化为经验证的恢复监督。MAGMA‑GEN 首先利用特权教练对早期的决策层错误进行假设,并给出局部的纠正或恢复动作。由于诊断可能出错,只有在相同状态、相同条件下重新执行后能够提升后续进度的候选才会被保留。这样即可从智能体自身的失败分布中获得监督样本,无需逐步的人类示范。
实验在交互式长时序操作任务上进行,结果表明 MAGMA‑GEN 在任务成功率和恢复能力上均优于蒸馏和轨迹修复基线,并在仿真和真实机器人平台上都能适应不断变化的任务约束。
点评