在大型语言模型(LLMs)的应用中,流利但错误的回答可能造成高昂的成本,因此仅有准确性是不够的。模型还必须具备识别自己错误可能性的能力。为此,我们提出了ConfidenceBench,这是一个评估15种前沿LLM的置信度校准基准,使用Brier分数作为评分规则,鼓励真实的概率报告。该方法通过提示引导获取置信度,无需访问模型的logits,适用于闭源和开源系统。
该基准包含200个私人多项选择题,涵盖四个类别:空间推理、高精度数学、单词查找和不可知问题。在三次独立运行中,Claude Opus 4.6和Gemini 3.1 Pro Preview获得了最低的Brier分数,均为0.103,两者均显著优于校准随机基线0.1875,而Gemini 3.1 Flash-Lite的得分为0.367,显示出严重的校准问题。模型家族之间的准确性与校准度存在显著差异:最准确的模型并非最佳校准,且有多个模型在保持合理准确度的情况下表现不如校准随机Brier基线。这些结果表明,口头表达的置信度校准是LLM可靠性的重要维度,补充了基于准确度的标准评估。
博主点评: 当前LLM的应用场景日益复杂,ConfidenceBench的提出为评估模型的置信度校准提供了新的视角。通过强调置信度的准确性,研究者能够更好地理解模型表现的局限性,从而在实际应用中做出更明智的决策。