NeFut Logo NeFut
EN 管理员登录

[AI学术] PRO-Step:面向检索增强生成的步骤级过程奖励优化

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

检索增强生成(RAG)通过将大语言模型的回答与外部知识对齐,提升了答案的可靠性。然而,在需要多跳推理的任务中,早期检索错误会导致后续步骤的错误传播,最终答案仍可能错误。传统的基于结果的优化只对最终答案打分,无法捕捉中间检索和推理的失误。已有的过程式方法虽然引入了步骤级信号,但仍然把每一步的得分映射到最终答案上,导致偶然正确的错误检索也会被误奖励。

为了解决上述问题,PRO-STEP 在步骤层面同时评估逻辑有效性证据依据。核心组件包括:

  1. 生成式过程评估模型(PRM):该模型接受当前步骤的文本以及对应的检索证据,输出两个分数,分别衡量逻辑合理性和证据匹配度。
  2. PRM 引导的价值树搜索:在搜索空间中构造偏好对(preference pairs),即将一个有效步骤与一个有缺陷的步骤配对,利用 PRM 的双向评分区分二者。
  3. 步骤级直接偏好优化(DPO):基于构造的偏好对,直接对生成策略进行梯度更新,使模型倾向于选择被 PRM 判定为更优的步骤。

实验在单跳和多跳问答数据集上进行,覆盖五个基准。结果显示,PRO-STEP 在 Exact Match(EM)F1 两项指标上均取得最高平均分,显著优于仅使用结果奖励或传统过程奖励的基线方法。代码、模型及训练数据已开源,地址:https://github.com/keemminnke/PRO-Step

点评:PRO-STEP 通过引入双维度的步骤评估和基于偏好对的直接优化,有效抑制了错误检索的累计效应,为 RAG 系统的可靠性提升提供了可行路径。

原文链接: https://arxiv.org/abs/2609.01658

[h] 返回首页