NeFut Logo NeFut
EN 管理员登录

[AI学术] 多跳检索增强阅读者如何受证据接口影响

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#algorithm #AI #Machine Learning

在多跳RAG评估中,top-k答案得分可能掩盖两种不同的失败:检索窗口可能丢失部分支持链,或者它可能包含适应性阅读者无法有效使用的支持形式。我们将这种面向阅读者的检索证据称为证据接口。

通过使用三个支持标注的多跳问答基准,我们比较了使用原始上下文、检索窗口和金标准支持诊断渲染的匹配适应性阅读者。这些比较区分了支持可用性失败和剩余的阅读者接口效应。

只有在检查完整的标注支持链是否存活后,top-k窗口才变得可解释:当支持链存活时,短排名窗口可以与原始上下文匹配或改进;当不存活时,缺失的支持解释了大部分损失。

金标准支持优先级改善了匹配阅读者;在2Wiki和MuSiQue上,支持监督的排名器提高了覆盖率,并以更低的提示成本恢复了原始上下文质量,同时保留了金标准的提升空间。

进一步的支持移除检查表明,收益依赖于暴露的证据,而不仅仅是答案先验。因此,在支持标注的评估中,top-k答案得分应与完整支持覆盖率一起报告。

博主点评: 该研究深入探讨了检索增强阅读者在多跳问答任务中的表现,强调了证据接口的重要性。通过对比不同支持形式,研究揭示了支持可用性对答案质量的影响,为未来的模型设计提供了重要的指导。具体的评估方式也为后续研究提供了参考框架。

原文链接: https://arxiv.org/abs/2607.17108

[h] 返回首页