NeFut Logo NeFut
EN 管理员登录

[AI学术] RAD:检索高质量示例提升决策能力

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#AI #optimization #Reinforcement Learning

摘要

离线强化学习(RL)从固定数据集中学习策略,避免了昂贵或不安全的环境交互。然而,其对有限静态数据集的依赖本质上限制了超出训练分布的泛化能力。基于合成数据增强的先前解决方案通常无法在(增强的)数据集中泛化到未见场景。

为了解决这些挑战,我们提出了检索高质量示例(RAD),为决策制定创新性地引入了一种检索机制到离线RL中。具体而言,RAD从离线数据集中检索高回报和可达状态作为目标状态,并利用生成模型基于这些目标生成子轨迹以进行规划。

由于这些目标是高回报状态,一旦智能体到达这样的目标,它可以通过遵循相关的高回报动作继续获得高回报,从而改善策略的泛化能力。

大量实验确认,RAD在多样化基准测试中实现了与基线相竞争或更优的性能,验证了其有效性。我们的代码可在 这里 获取。

博主点评: RAD方法通过检索机制有效提升了离线强化学习的泛化能力,尤其是在高回报状态的利用上,为决策系统的智能化提供了新的方向。其创新点在于结合了生成模型,值得在实际应用中深入探索。

原文链接: https://arxiv.org/abs/2507.15356

[h] 返回首页