NeFut Logo NeFut
EN 管理员登录

[AI学术] MAGMA‑GEN:通过反事实再执行实现模糊失败的验证恢复监督

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#Machine Learning #optimization #Artificial Intelligence

层次化机器人系统在执行长时序操作任务时,需要在高层做语义决策来调度随机的低层技能。此时,失败的 rollout 往往是模糊的:下游状态不佳可能来源于高层决策错误、观测不完整,或是决策本身正确但执行失败。传统的监督学习缺少这类恢复状态的数据,强化学习又受稀疏奖励和非局部信用分配的限制。

为此我们提出 MAGMA‑GEN,一个基于 on‑policy 的数据生成管线,能够把模糊的失败 rollout 转化为经验证的恢复监督。MAGMA‑GEN 首先利用特权教练对早期的决策层错误进行假设,并给出局部的纠正或恢复动作。由于诊断可能出错,只有在相同状态、相同条件下重新执行后能够提升后续进度的候选才会被保留。这样即可从智能体自身的失败分布中获得监督样本,无需逐步的人类示范。

实验在交互式长时序操作任务上进行,结果表明 MAGMA‑GEN 在任务成功率和恢复能力上均优于蒸馏和轨迹修复基线,并在仿真和真实机器人平台上都能适应不断变化的任务约束。

点评

原文链接: https://arxiv.org/abs/2609.20056

[h] 返回首页