摘要
强化学习使得Agentic RAG系统能够通过可验证的结果奖励学习多轮搜索,但全零回滚组未能提供比较信号,可能掩盖有用的搜索行为。我们提出了EviBack,这是一种证据约束的教师回退方法,为此类组提供辅助监督,同时保持可验证的Actor奖励。该方法将证据评估与答案精炼分离,防止参考答案覆盖证据不足的判断。
EviBack实现了一个全自动的端到端GPT-5.5辅助的APE管道,该管道从手动编写的单提示双任务教师开始,自动划分和标记回滚数据,并执行消融、任务分解、评估和选择,最终生成一个门控的两阶段教师。与手动设计相比,生成的教师在下游F1和有效答案率上有所提升,同时减少了搜索、重复查询和强制终止的发生。
在七个开放域问答基准和三个Qwen3规模的对比中,EviBack在F1上超过了Search-R1,并提高了单跳和多跳的宏F1。我们保证代码将在后期公开发布。
博主点评: EviBack通过将证据约束与教师回退结合,显著提升了多轮搜索的有效性,展示了强化学习在复杂搜索任务中的潜力。这种方法不仅优化了结果,还有效降低了冗余查询的数量,具有广泛的应用前景。