NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过推理状态传播学习过程奖励

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

过程奖励模型(PRM)通过对中间推理状态提供细粒度评估信号,在测试时的规模化和强化学习中表现出显著效果,但其训练高度依赖昂贵的过程标注。\ \ 现有的 PRM 往往将推理前缀独立建模,缺乏将最终结果用于指导中间状态学习的显式机制,导致过程监督与结果监督难以协同。\ \ 我们提出 推理状态传播(RSP),为每个推理前缀分配二元有效性状态,并在推理轨迹上建模相邻状态的转移。具体而言,RSP 预测 break 概率(有效状态转为无效)和 repair 概率(无效状态恢复为有效),通过这些转移将中间状态与最终状态相连。\ \ 在训练时,过程标注仍用于监督中间状态的有效性,而结果标签监督最终状态,并通过状态转移向前传播学习信号,从而实现过程监督与结果监督的互补。\ \ 实验在推理搜索、答案选择和强化学习三个场景中进行评估。相较于代表性 PRM 基线,RSP 在所有任务上均实现稳健提升:在束搜索(beam search)中相对于 Qwen2.5‑Math‑PRM 平均提升 5.6%,在强化学习中提升 2.1%。\ \ 点评:RSP 通过显式的状态转移机制成功将结果信息回溯至中间推理步骤,显著降低了对大量过程标注的依赖,为大规模推理任务提供了更高效的学习框架。

原文链接: https://arxiv.org/abs/2609.39220

[h] 返回首页