在离线强化学习(RL)中,世界模型被广泛应用以提高样本效率,并生成超出固定数据集的经验。然而,这些模型在数据覆盖薄弱的区域容易受到模型利用的影响。以往的研究通常通过收集更多的专家演示来解决这一问题,但这往往代价高昂、不安全或不可获得;或者采用保守算法以避免不确定区域,从而限制了模型的泛化能力。
我们提出直接通过人类对想象中的回合的偏好来修复模型利用,利用人类对明显动态幻觉的强直观物理感知能力。我们将其形式化为基于人类反馈的动态学习(DLHF),使用布拉德利-特里偏好损失在学习的动态模型下进行轨迹对数似然的优化。
然而,简单的DLHF在样本效率上存在不足,因此我们引入了RENEW,通过利用认知不确定性来聚焦于模型最易被利用的地方进行微调。我们在多个Jumanji和经典控制环境中进行了评估,发现简单的DLHF需要过大的偏好预算,而RENEW通过改善样本效率、限制灾难性遗忘及减少预训练世界模型中的利用,令该框架变得实用。
综合来看,我们的结果初步证明了偏好可以直接监督世界模型的动态,为解决离线模型基础RL中的利用问题提供了新思路。
博主点评: 本文通过引入人类偏好来优化世界模型的动态学习,展示了将人类直觉与机器学习结合的新方法。RENEW的提出不仅提高了样本效率,还有效减少了模型利用的问题,具有重要的理论和实际应用价值。该研究为未来在离线强化学习中的应用提供了新的方向。