GraphEcho 是一个用于评估大语言模型(LLM)图代理在证据利用上的偏差的基准。它通过固定证据内容,仅改变路径数量和证据来源,观察模型是否把多次遍历同一证据误认为独立的支持。实验在受控的合成数据上进行,结果显示不同模型的判断会随路径冗余而产生系统性偏移:即使在冻结的代理中,冗余路径也会显著提升重复走访的比例。为缓解该问题,作者提出了基于来源感知的后训练方法(PAPT),该方法能够降低重复访问次数并提升合成任务的准确率,但同时覆盖的独立来源数量减少。在真实的科学声明评估中,PAPT 仍然能够抑制重复,却导致整体准确率下降。整体结论表明,探索效率与有效证据利用之间存在张力:代理可以学会停止自我重复,却可能错失必要的信息。GraphEcho 为衡量图代理的结论质量和探索多样性提供了可控的实验平台。
点评