训练大型语言模型代理在长视野环境中需要将稀疏的终端结果分配给个体动作。现有的批评者免费方法将轨迹级别的奖励均匀地传播到每个步骤,而最近的方法通过匹配重复的状态来构造步骤级别的组,并在每个组内比较动作。前者无法区分失败轨迹中的有用动作和成功轨迹中的无效动作。后者依赖于直接从个体轨迹结果和固定权重融合的步骤级别信用。我们提出 Gated-BEPO,它从经验回滚图中推导出步骤级别的信用。对于每个回滚组,Gated-BEPO 构造一个经验图,并通过平均备份贝尔曼固定点估计节点值,该点反映了当前策略的经验动作分布。然后,我们使用广义优势估计沿着每个采样的轨迹积累这些时间差分残余,产生捕获立即和下游效果的步骤级别贝尔曼优势。为了自适应地融合集体和步骤级别的信用,置信度门控仅在有多个观察到的后继状态的状态下纳入贝尔曼信用,否则使用集体级别的信用。实验结果表明,在 WebShop、ALFWorld 和视觉 Sokoban 上,Gated-BEPO 获得了语言和视觉语言模型的一致性改进,而诊断性消融支持贝尔曼固定点值估计的有效性,并表明步骤级别的信用应该被选择性地而不是均匀地纳入最终优势。 博主点评: Gated-BEPO 是一个创新的信用分配方法,它能够有效地将稀疏的终端结果分配给个体动作,尤其是在长视野环境中。它通过经验回滚图和贝尔曼固定点值估计来计算步骤级别的信用,并使用置信度门控来自适应地融合集体和步骤级别的信用。实验结果表明 Gated-BEPO 在语言和视觉语言模型上都获得了改进,这使得它成为大型语言模型代理训练中的一个有前途的方法。