NeFut Logo NeFut
EN 管理员登录

[AI学术] 专家行为先验强化学习:提升样本效率的新突破

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#algorithm #optimization #Reinforcement Learning

摘要

行为先验强化学习(BPRL)作为一种新兴的范式,通过利用离线示范获得的策略先验,提升了在线强化学习的样本效率。然而,现有的大多数BPRL方法依赖于静态的离线数据集,这些数据集通常存在数据多样性不足和轨迹质量次优等问题。

这种依赖限制了策略先验的有效性,妨碍了在线训练中的策略利用与稳定性。因此,智能体往往面临低效探索和不稳定学习动态的问题。

为了解决这些局限性,我们偏离了现有的离线预训练方法,提出了一种专家行为先验(EBP)算法。具体而言,我们引入了一种Q引导的条件变分自编码器(Q-CVAE),该模型能够直接从在线重放缓冲区中学习生成专家策略先验。这使得在不依赖于预先收集的专家轨迹的情况下,能够生成高价值的动作来指导策略更新。

为了进一步增强策略利用,我们提出了一种专家策略引导(EPG)机制,该机制从生成的支持集选择专家动作,并集成了一个策略梯度修正(PGC)模块,以协调Q引导与专家监督,促进稳定且一致的策略改进。

在机器人控制(Gym、PyBullet)和工业控制(DMControl)基准上的广泛实验表明,EBP显著超越了当前最先进的在线强化学习算法,实现了更高的样本效率和更稳定的收敛。

博主点评: EBP算法通过创新的Q-CVAE架构和专家策略引导机制,有效解决了传统BPRL在数据多样性和轨迹质量上的不足,展现了在实际应用中的巨大潜力。这种方法的提出或将为强化学习领域带来新的研究方向与应用前景。

原文链接: https://arxiv.org/abs/2607.21302

[h] 返回首页