在强化学习(RL)领域,普遍观察到在线强化学习在多种性能指标上优于离线方法。特别是,经过RL训练的策略在分布外(OOD)行为上表现更佳,而仅依赖模仿学习的模型则常常面临挑战。最近的研究引入了一个关注OOD的基准,报告称经过RL训练的视觉-语言-动作(VLA)策略在OOD性能上明显优于经过监督微调(SFT)训练的同类模型,并在分布内(IND)性能上也稍有改善。
本研究探讨了混合离线-在线训练是否能够结合这两种方法的优势。具体而言,我们研究了通过离线数据或离线训练的参考策略对RL方法进行正则化的效果。我们在OOD基准上评估这些方法,并与仅使用离线训练和标准RL进行比较。
结果表明,尽管离线训练本身在OOD性能上表现有限,但将离线监督引入RL可以保持强大的OOD能力,同时显著提高训练效率。特别是,这种引导方法在性能上接近标准RL,而训练预算却仅需约一半。混合方法不仅没有在速度与OOD性能之间产生权衡,反而在保留强大OOD能力的同时实现了效率的提升。
项目页面: 离线监督强化学习项目
博主点评: 本文通过结合离线监督和强化学习,提出了一种高效的训练方法,解决了传统RL在OOD表现上的不足。这种混合方法在保持OOD能力的同时,显著降低了训练成本,为未来的视觉-语言-动作模型开发提供了新的思路。