NeFut Logo NeFut
EN 管理员登录

[AI学术] 共识高估证据:LLM 判官错误依赖性

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

共识常被视为 LLM 判官判断正确性的强证据,这一假设基于判官错误相互独立。然而,实际中判官往往采用相似的训练与评估方式,导致错误出现关联。我们在十位判官的主实验中测得错误的平均两两相关系数为 $0.21$,这意味着十位判官提供的信息量约等同于 $3.5$ 位独立判官。对高精度前沿判官(包括不同供应商的模型)进行评估时,错误关联更为显著。若忽略共享错误,最多有 $28\%$ 的比较会错误地认为某系统显著优于另一系统,而考虑共享错误后则不成立。错误的分布模式也会影响共识:广泛共享的错误与集中在少数判官的错误对投票方式的偏好不同,仅测量整体相关度不足以捕捉这些差异。基于此,我们建议使用少量可信样本估计判官准确率并识别共享错误,在分析结果时将这些共享错误纳入考虑,并在对新数据应用投票前,先用可信样本选定合适的投票方法。

点评

原文链接: https://arxiv.org/abs/2609.22512

[h] 返回首页