摘要
离线强化学习(ORL)承诺提供安全且样本高效的部署,但现有方法依赖于未记录的在线交互进行超参数调整,并缺乏可靠的完全离线初始在线性能估计。我们提出了SOReL,这是一种完全离线的贝叶斯模型驱动强化学习方法,能够学习动态的后验分布,通过预测不确定性估计策略价值,并实现完全离线的超参数选择。
我们进一步提出TOReL,将这一调优框架扩展到任意的无模型和模型驱动的ORL算法。我们提供了一个遗憾分析,表明贝叶斯离线强化学习在标准正则条件下实现了最小最大最优参数速率。总的来说,我们的方法建立了一个实用且理论基础扎实的完全离线强化学习框架。
博主点评: 本文提出的SOReL和TOReL方法在理论与实践上都为离线强化学习领域带来了重要进展,尤其是在超参数选择与策略价值估计方面,为未来的研究提供了新的方向。通过贝叶斯方法的引入,离线学习的安全性与效率得到了显著提升。