NeFut Logo NeFut
EN 管理员登录

[AI学术] 审计深度研究代理的证据选择偏差

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

深度研究代理会将检索到的证据合成为带引用的报告,但即使引用广泛,报告仍可能得出误导性结论。传统的引用正确性检查只能验证每条引用是否支持对应的主张,无法判断自适应检索是否覆盖了可供评估的全部文档集合(候选池)。早期的检索结果会影响后续查询、文档选择以及停止时机,从而使代理阅读的文档成为一个有偏的子样本,而现有评估很少考虑这种选择偏差。

我们将该问题形式化为自适应证据抽样,并提出 因果证据选择校正 (Causal Evidence Selection Correction, CESS)。CESS 的核心思路是:对每个候选文档预测其证据方向(正向/负向),并利用记录的文档被选中的概率以及检索轮次的概率,对候选池的平均证据方向进行校正。具体步骤包括:

  1. 计算每篇文档的证据得分 $e_i$(正向为正,负向为负)。
  2. 记录每篇文档在第 $t$ 轮被选中的概率 $p_{i,t}$。
  3. 使用加权平均 $$\hat{E}=\frac{\sum_{i,t} p_{i,t}\, e_i}{\sum_{i,t} p_{i,t}}$$ 对候选池的整体证据方向进行估计。
  4. 当检索轮数较少导致样本稀疏时,引入 收缩(shrinkage)技术,使估计向整体均值回归,提升稳定性。
  5. 对于某些文档根本未被抽样的情况,使用置信区间代替点估计,以反映不确定性。

我们还证明,估计候选池的平均证据方向 与 衡量搜索策略改变后阅读证据的变化 并不等价。后者需要通过干预实验(intervention)来实现,即在相同候选池上强制执行不同的检索策略并比较结果。

在 MS2 系统综述基准上的实验表明,CESS 将相对于候选池平均的绝对误差降低了 $9.2\%$,并将对抗文档排序导致的估计变化降低了 $39.4\%$(相较于仅对已阅读文档的证据得分做平均)。在公开的 Open Deep Research 代理的轨迹上,这两个指标的改进分别达到了 $60.1\%$ 和 $87.2\%$。进一步的 4,800 条配对干预轨迹验证了 校正池估计 与 测量策略效应 是两项不同的任务。

因此,CESS 能够审计报告背后的证据方向是否真实反映了可供评估的文档集合,而单独的干预分析则用于衡量搜索决策本身的影响。

点评

原文链接: https://arxiv.org/abs/2609.39026

[h] 返回首页