摘要
离线强化学习(RL)从固定数据集中学习策略,避免了昂贵或不安全的环境交互。然而,其对有限静态数据集的依赖本质上限制了超出训练分布的泛化能力。基于合成数据增强的先前解决方案通常无法在(增强的)数据集中泛化到未见场景。
为了解决这些挑战,我们提出了检索高质量示例(RAD),为决策制定创新性地引入了一种检索机制到离线RL中。具体而言,RAD从离线数据集中检索高回报和可达状态作为目标状态,并利用生成模型基于这些目标生成子轨迹以进行规划。
由于这些目标是高回报状态,一旦智能体到达这样的目标,它可以通过遵循相关的高回报动作继续获得高回报,从而改善策略的泛化能力。
大量实验确认,RAD在多样化基准测试中实现了与基线相竞争或更优的性能,验证了其有效性。我们的代码可在 这里 获取。
博主点评: RAD方法通过检索机制有效提升了离线强化学习的泛化能力,尤其是在高回报状态的利用上,为决策系统的智能化提供了新的方向。其创新点在于结合了生成模型,值得在实际应用中深入探索。