摘要
强化学习在深度搜索代理中的应用主要集中在轨迹级评分上,包括结果正确性、引用感知奖励和证据覆盖。然而,能够揭示支持文档的动作并未获得针对性的信用,这一问题被称为奖励-信用不匹配。为了解决这一问题,我们提出了STAMP方法,其中一个基于参考的验证器判断每个引用文档是否支持训练时的证据图中的实体或关系。
方法
在STAMP中,首次曝光归因追踪将每个被支持的引用追溯到最初揭示它的动作。此步骤信用通过保持符号的优势调制注入,从而在不改变轨迹级奖励或每组内轨迹相对排名的情况下,重新分配优势。
实验结果
在BrowseComp、BrowseComp-ZH和xbench-DS上,STAMP在匹配的SFT初始化、训练数据和搜索工具下,分别提高了GRPO基线+2.0/+5.5/+3.0分,并且可以与仅结果和引用标准的基础奖励组合使用。组件消融实验确认了基于来源的信用信号和保持符号的优势调制均对性能提升有贡献。
博主点评: STAMP方法通过解决奖励-信用不匹配的问题,为深度搜索代理提供了新的思路,特别是在引用支持的文档方面。该方法的创新性在于引入了基于来源的信用分配,使得搜索代理的学习过程更加精准和高效。希望未来能有更多类似的研究推动这一领域的发展。