NeFut Logo NeFut
EN 管理员登录

[AI学术] 下一步该问什么?基于检索的部分证据下的问题学习

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#algorithm #AI #Machine Learning

交互式检索在部分证据下是一种顺序信息获取任务:智能体需要决定提哪个问题能够为下一轮检索提供最有价值的证据。现有系统通常通过模仿离线排列的候选问答对来训练决策,但问题的价值实际上取决于它引发的回答以及对检索结果的下游影响。我们首先证明,候选的区分度和感知有用性可以作为该目标的弱监督信号。随后提出 RAVEL(Retrieval‑Aware online reinforcement Learning),它是一种面向交互式人物再识别的在线强化学习框架。RAVEL 从监督式问题生成初始化,直接观察当前的 Top‑4 候选,并利用完整的问答‑检索闭环中的排名反馈来优化提问策略。实验在 Interactive‑PEDES 数据集上进行,结果显示 RAVEL 在五轮交互中逐步提升检索性能。进一步分析表明,RAVEL 将提问预算重新分配到局部的开放式属性上,这类属性能够提供更有价值的检索证据,对最初难以检索的查询带来最大提升。

点评:RAVEL 通过将检索反馈直接纳入强化学习循环,克服了离线模仿的局限,实现了更具适应性的提问策略。尤其是对开放式属性的聚焦,使系统在处理复杂查询时表现出更强的鲁棒性,为交互式检索提供了新的研究方向。

原文链接: https://arxiv.org/abs/2609.21924

[h] 返回首页