NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越答案置信度:对黑箱决策模型自我知识的受控审计

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#Machine Learning #LLM #Artificial Intelligence

决策模型会输出概率,用于路由、回避和自动化操作。校准可以让这些概率在整体上有意义,但并不能说明低置信度是偶然还是缺乏知识,也无法判断模型在超出已知范围时置信度是否会下降。我们在 Jev 决策模型上进行了一系列受控审计,使用了 15 个公开数据集和 6 种生成任务族,并配对了信息量不同的干预,以固定同一条目进行比较。

Jev 在熟悉的闭合选择任务上实现了良好的置信度校准,但在缺乏答案相关信息时仍会给显著选项分配高达 0.80 的置信度;在超出已观察到的知识边界的新闻上,置信度超过实际准确率 0.21–0.33,且对早期月份的重新校准并未消除这一差距。

针对性的是/否问题能够提供更清晰的读数:判断结果是否已确定的 AUROC 达到 1.00,判断证据是否充分的 AUROC 为 0.95,而同一批次上仅使用置信度的 AUROC 为 0.85。询问 Jev 是否知道答案能够标记出捏造实体和边界外新闻(AUROC 0.91),但在使用真实姓名或去除日期时,这一优势消失,表现与普通置信度无差别。

因此,对黑箱模型的知识审计必须加入对表面线索的显式控制,以防止误判。代码实现可在 https://github.com/Syntheme/beyond-answer-confidence 获取。

点评

原文链接: https://arxiv.org/abs/2610.01006

[h] 返回首页