NeFut Logo NeFut
EN 管理员登录

[AI学术] LAPO:多轮搜索推理中的自生成过程奖励新方法

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Machine Learning

摘要

强化学习在多轮搜索推理中通常依赖终局结果奖励,这无法区分有用、冗余和有害的中间交互。我们提出了LAPO,一种基于向后留一轮归因的自生成过程监督方法。对于每个搜索轮次,LAPO用固定的 [DELETE] 占位符替换该轮及其检索观察,并测量当前策略的黄金答案的平均对数似然的变化。这个答案似然增益估计了该轮的贡献,同时保留了所有下游交互,从而允许在完整的推理上下文中评估早期证据。

LAPO进一步应用了符号一致性门控,仅保留与其原始归因分数方向一致的标准化过程优势。该方法无需额外的奖励模型、教师、验证者或 LLM 作为裁判。通过在七个知识密集型问答数据集上进行本地检索,LAPO 实现了平均准确匹配分数 0.326,超越了最强的步奖励基线 IGPO 0.053。消融实验表明,向后归因和符号一致性门控带来了互补的好处,证明了策略派生的回顾性归因可以为多轮搜索代理提供有效的过程监督。

博主点评: LAPO方法通过引入留一轮归因,巧妙地解决了多轮搜索推理中奖励信号的不足,增强了模型对中间步骤的理解与评估。这一创新不仅提高了性能,还为未来的自监督学习提供了新思路,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.13501

[h] 返回首页