在竞争任务中部署的机器人必须在击败对手的同时保证安全。传统的安全强化学习同时学习任务成功和避免失误,导致训练复杂且策略易被有意攻击利用。为此我们提出 Safety to Competence (S2C),一种两阶段的强化学习框架,将安全合成与竞争任务学习解耦。我们将竞争交互建模为安全关键的马尔可夫博弈,并证明在所有玩家都遵守安全动作时,完美过滤能够保持策略不可被利用。S2C 首先通过对抗性强化学习训练一个鲁棒的安全过滤器,然后在任务策略的训练过程中将该过滤器嵌入环境,部署时直接使用同一过滤器。实验在模拟的 touchdown 游戏中进行,S2C 超越八种安全 RL 基线,取得最高的胜率和 Elo 评分,并显著降低可利用性。硬件压力测试中,面对真人对手,S2C 同样表现出色。
点评