NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越置信度:通过检索对齐的测试时缩放用于多轮搜索代理

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

置信度投票通过对每个并行LLM rollout的内部信号(如 token 的对数概率)进行加权,已被广泛用于单轮推理。然而,现代 LLM 越来越多地充当多轮搜索代理,需要检索外部文档并将其拼接到上下文中。本文实验表明,置信度投票在此类多轮设置下表现不佳,根本原因是“复制膨胀”:检索到的文档被直接加入上下文后,来自文档的 token 会获得系统性地过高的对数概率,导致同一问题内部的置信度分布趋于平坦,削弱加权投票的区分能力。为了解决这一问题,作者提出检索对齐投票(Retrieval‑Grounded Voting,RGV),其评分依据是最终答案与检索到的文档之间的词汇重叠度。由于该信号在受污染的上下文之外计算,RGV 既避免了对 token 概率的依赖,也无需额外的 LLM 调用。实验在四个搜索代理基准和五种不同的 LLM 上进行,RGV 始终优于置信度投票,最高提升 5.4% 的整体准确率,并在少数正确答案仅出现在 1‑2 次 rollout(共 8 次)的情形下提升 35%。

博主点评:本文精准定位了多轮检索场景下置信度投票的根本缺陷,并提出了实现简洁、效果显著的检索对齐投票方案。实验覆盖面广,提升幅度在实际应用中具有重要意义,值得搜索型 LLM 开发者参考。

原文链接: https://arxiv.org/abs/2608.24024

[h] 返回首页