NeFut Logo NeFut
EN 管理员登录

[AI学术] 风险不是审查价值:在有限审查预算下的错误答案曝光

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

LLM 助手往往会生成远超人类审查能力的答案数量。传统评估关注答案是否错误、缺乏支持或置信度低,而在审查预算受限的情境下,核心问题转为在固定的审查资源下应优先检查哪些答案。仅凭风险水平不足以决定优先级:高风险答案可能难以修复,而中等风险答案往往可以直接依据已有证据纠正。为此,本文将审查优先级建模为曝光降低问题,提出审查价值概念,将估计错误率、干预可行性、影响程度和审查成本综合评估。评估指标包括错误答案曝光比率(WAER),即未审查的错误答案比例,以及修复后残余曝光比率(PRRE),即在确定性基准修复后仍然暴露的错误比例。PRRE 的计算使用修复规则,这些规则不再数值复用用于排序的可行性分数。实验在 720 条 TAT‑QA/SciFact 高压基准上进行,结果显示,在 20% 审查预算下,基于审查价值的排序能够将答案层面的 WAER 基本保持不变(0.605 对比 0.600),但将 PRRE 从 0.881 降至 0.716。该发现表明,可信的 LLM 评估应同时关注错误检测和有限审查能力对错误答案曝光的削减效果。

点评

原文链接: https://arxiv.org/abs/2609.07095

[h] 返回首页