NeFut Logo NeFut
EN 管理员登录

[AI学术] RIFAR:面向持续机器人学习的可靠性与遗忘感知回放

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#algorithm #AI #Machine Learning

真实的具身智能要求机器人将持续的真实世界经验转化为持久且可迁移的技能。这需要在任务和环境不断演化时,能够在不侵蚀已有知识的前提下整合新能力的持续学习。经验回放通过重放过去的演示来缓解遗忘,但随着任务数量增加,完整存储演示的成本会急剧上升。世界‑动作模型提供了一种生成式替代方案,它通过联合预测动作和未来观测来重建过去的经验。然而,视觉上连贯的 rollout 可能包含无法实现预测转移的动作,而新任务的适应又可能破坏已学行为。为此,RIFAR 结合了可靠性筛选和漂移感知回放选择。它首先利用紧凑的演示前缀重构轨迹,并使用冻结的逆动力学模型评估动作‑视觉一致性。训练阶段,将当前演示与筛选后质量最高的轨迹混合使用。随后,RIFAR 在相同的历史输入上比较适应前后的动作预测,依据归一化漂移大小从同一筛选池中重新挑选轨迹继续训练。实验在三个 LIBERO 套件以及真实机器人上进行,RIFAR 在基于 WAM 的生成式回放中超越了此前的最先进方法。在 LIBERO‑Goal 上,仅保留每任务 320 步历史数据(约为 50‑演示回放的 4.9%),即可实现 90.97 的 AUC。

点评

原文链接: https://arxiv.org/abs/2610.03079

[h] 返回首页