NeFut Logo NeFut
EN 管理员登录

[AI学术] SLAC:安全高效的真实机器人强化学习新突破

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#robotics #Reinforcement Learning #Simulation

摘要

构建能够自主操作的家庭和工业机器人,需掌握高自由度(DoF)系统的控制,例如移动操纵器。虽然强化学习(RL)在自主获取机器人控制策略方面展现出潜力,但将其扩展到高自由度的实体仍面临挑战。直接在现实世界中应用RL需要安全探索和高样本效率,而这在实践中难以实现。相对而言,模拟到现实的RL往往由于现实差距而变得脆弱。

为了解决这一问题,本文提出了SLAC方法,该方法通过利用低保真度模拟器来预训练任务无关的潜在动作空间,使得复杂实体的现实世界RL变得可行。SLAC通过一种定制的无监督技能发现方法来训练这一潜在动作空间,旨在促进时间抽象、解耦和安全性,从而便于高效的下游学习。

一旦学会了潜在动作空间,SLAC将其作为新型离线策略RL算法的动作接口,通过与现实世界的交互自主学习下游任务。我们在一系列双手移动操纵任务上评估SLAC,相较于现有方法,SLAC取得了最先进的性能。值得注意的是,SLAC在不到一小时的现实世界交互中学习了丰富接触的全身任务,无需任何演示或手工设计的行为先验。

更多信息及机器人视频可访问 robo-rl.github.io

博主点评: SLAC方法以低保真模拟器为基础,通过无监督技能发现有效提升了现实世界中强化学习的效率与安全性,展现了在复杂机器人任务中的应用潜力。这为未来的机器人自主学习铺平了道路,尤其是在没有大量数据或示例的情况下。其在时间抽象和解耦方面的创新思路,值得深入研究与借鉴。

原文链接: https://arxiv.org/abs/2506.04147

[h] 返回首页