在复杂任务中,强化学习(RL)已成为提升大型语言模型(LLMs)的广泛采用技术。然而,现有的RL方法在训练具有长时间交互的智能体时仍面临挑战。其中一个主要瓶颈是难以区分不同动作在长时间交互中的贡献,导致高优化方差。
为了解决这个问题,我们提出了一种新颖的策略梯度方法——回顾策略优化(HPO)。该方法将当前策略分布和回顾分布投影到意图空间,并从它们之间的Wasserstein距离中提取低方差的学习信号。
我们从理论和实证两个方面展示了在意图空间中聚合语义相似的状态和动作能够产生有界方差的估计器,从而稳定地提高策略性能。
我们的代码已在线提供。