NeFut Logo NeFut
EN 管理员登录

[AI学术] 大型语言模型中置信度的计算基础

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#AI #Machine Learning #Neural

在语言模型的可信部署中,可靠的置信度——模型自身答案正确的概率——至关重要。现有研究主要评估置信度如何预测正确性以及其校准情况,但更根本的问题仍未得到解答:置信度信号本身代表什么?答案 logits 可能反映一个潜在的决策变量,这个变量足以计算规范性置信度,或者它只是一个结合可用证据的启发式偏好信号,而非贝叶斯方式。

我们使用统计决策置信度(SDC)这一来自计算神经科学的规范框架来探讨这一点。将答案-logit 差(LD)视为潜在决策变量的候选读出,我们测试了 SDC 预测的定性特征。

在三个感知判别任务和一个基于记忆的决策任务中,涵盖三种多模态非推理模型和一种推理模型,LD 满足了这些特征——包括诊断性的正确/错误折叠-X模式——显示在这些环境下,答案 logits 作为潜在决策变量的单调读出,而非启发式偏好分数。

在复杂的视觉推理中,LD 继续预测正确性,超越了客观任务难度,但 SDC 的完整几何特征缺失,表明在缺乏明确规范过程模型时该框架的当前边界。

这些结果为多模态语言模型中的置信度提供了计算解释,明确了答案 logits 何时作为潜在决策变量的读出,并确立了 SDC 作为研究生物与人工智能置信度的统一框架。

博主点评: 本文揭示了大型语言模型中置信度的计算机制,指出答案 logits 可以作为潜在决策变量的有效信号,而非简单的偏好指标。这为我们理解和优化语言模型的可靠性提供了新的视角,尤其是在多模态任务中的应用潜力值得进一步探索。

原文链接: https://arxiv.org/abs/2607.12447

[h] 返回首页