在未知环境动态和缺乏合适奖励函数的情况下,我们探讨了安全训练智能体策略的问题。考虑到安全关键环境,传统的强化学习方法显得不够实用,因此我们引入了人类输入的资源。我们提出了DROPJ,这是一种以人为中心的方法,旨在实现安全训练与部署。
首先,我们从真实世界轨迹的数据集中学习一个世界模型(即学习的模拟器)。然后,人类在这个学习到的模拟器中进行游戏,以提取多个信息丰富的模拟轨迹。
接着,我们从这些轨迹中抽取一对对的模拟轨迹段,并请人类对这些段进行偏好选择,同时给出选择的理由(即理由化)。
基于这些理由化的偏好,我们训练一个奖励模型,并利用它与世界模型结合,直接通过模型预测控制部署智能体。
通过真实用户实验,我们发现,从用户生成的信息丰富的模拟轨迹显著降低了训练过程中的计算成本,并且在部署过程中也能提升性能。
我们展示了,在学习的模拟器中,使用偏好而非其他类型反馈显著提高了部署性能。此外,伴随偏好的安全理由可以显著增强安全性,或在部署中优先考虑用户所规定的安全方面。
博主点评: 该研究通过人类偏好与理由化的结合,为安全智能体的训练与部署提供了创新的方法,突显了人类知识在复杂环境中的重要性,预示着未来强化学习领域的一个重要发展方向。