在大语言模型(LLM)实际部署中,一个核心难题是区分不确定性是来源于任务本身的不可约变异(即随机不确定性),还是模型知识的不足(即认知不确定性)。在语言任务里,输入的歧义或描述不完整往往会导致多种合理解释,这是一种典型的随机不确定性来源。
现有的分解方法通常先生成若干可能的澄清(clarifications),随后在每个澄清下让模型给出答案,最后比较这些答案的差异来估计随机不确定性。我们指出,这种做法并非必要:答案本身往往是冗余的,会增加计算开销,还可能因答案中泄露的模型知识而混淆认知不确定性的测量。
理论上,我们证明仅利用澄清空间即可直接衡量歧义引起的随机不确定性,而无需对每个澄清求解答案。基于此,我们提出了一种仅基于澄清的估计框架:先检测输入的多种合理解释,然后在解释空间上计算分布散度,以得到歧义度量。
在三个公开基准上将歧义检测作为评估手段进行实验,结果显示:该直接方法的AUROC提升至63.34%(相较于传统的60.85%),输出token数量降低4‑26倍,API调用次数降低2.2‑3.5倍,并且与认知不确定性的相关性显著下降。
总体而言,实验表明,从解释空间而非响应空间估计歧义导致的随机不确定性更加可靠且高效。
点评