在大型语言模型(LLM)中,校准是评估模型置信度的主要标准,但仅依赖校准是不够的。它允许不合理的估计器存在,依赖于评估分布,并且未能测试估计值是否可以被解释为一致的、潜在的概率函数。
我们实际上需要的是LLM置信度估计满足一致性概率信念的条件。我们将这些条件从三个方面进行了形式化(结构一致性、真实度和有用性),并将其操作化为C1指标。
尽管广泛使用的估计器看似校准良好,但系统性地违反了这些条件:模型在31%的时间内对逻辑上更简单的问题赋予较低的置信度,而常见的降低RMSCE的干预措施则未能改变结构性违规,这表明校准与概率有效性是正交的。
强化学习和思维链方法在提高有用性指标的同时,并未恢复一致性。我们的结果显示,当前的LLM置信度估计无法被解释为一致的概率;我们的框架提供了测量和弥补这一差距的工具。
博主点评: 本文深入探讨了LLM置信度估计的缺陷,提出了新的评估框架,强调了结构一致性和真实度的重要性。通过系统分析,作者揭示了传统校准方法的局限性,为未来的研究指明了方向。