NeFut Logo NeFut
EN 管理员登录

[AI学术] 离线质量多样性强化学习的层次技能策略学习

发布于:2026-08-21 22:00 最后更新:2026-08-22 11:02
#algorithm #AI #Machine Learning

近期研究聚焦于如何利用预先收集的数据集提升强化学习(RL)的策略性能和样本效率。一个行之有效的思路是两阶段策略:第一阶段从离线数据中提取多样化的低层技能策略,第二阶段训练高层策略以完成特定任务。传统做法多采用无监督方法(如轨迹 VAE)进行低层技能提取,但其效果高度依赖数据质量。为克服此局限,我们提出 QDOS(Quality-Diversity Offline Skill learning),构建统一的离线‑在线学习管线。QDOS 在预训练阶段引入 Advantage‑Weighted Quality‑Diversity 目标,将每段轨迹的优势估计作为权重,兼顾技能多样性与价值,从而得到既丰富又高价值的低层技能表示。随后,采用 双数据集复用 策略:离线数据既用于技能预训练,又通过 伪标签 填充在线 replay buffer,进一步提升探索效率。实验在结构化操作任务和无结构的运动任务上均显著超越强基线,验证了 QDOS 在稀疏奖励环境中加速探索、提升最终回报的能力。

博主点评:QDOS 将优势信息巧妙融合进质量多样性目标,使得离线技能提取不再盲目追求多样,而是聚焦高价值行为。双数据集复用的设计进一步拉通了离线‑在线的学习闭环,为实际机器人和游戏 AI 提供了更稳健的迁移路径。未来可探索更细粒度的优势估计和跨任务的技能共享机制。

原文链接: https://arxiv.org/abs/2608.19684

[h] 返回首页