NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越语义等价:逻辑图在LLM不确定性量化中的应用

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Machine Learning

在安全敏感的应用中,大型语言模型(LLMs)经常产生自信但不可靠的输出,这对其部署构成了重大挑战。现有的不确定性度量方法如语义熵主要捕捉语义等价层面的共识,却很大程度上忽略了不同答案之间的逻辑关系。

因此,它们往往高估不确定性,并在生成的响应形式多样但逻辑上兼容的情况下(例如,仅在细节或特异性上有所不同)错误地标记幻觉。为此,我们提出了逻辑图不确定性(Logical Graph Uncertainty, LGU),一个明确建模答案间蕴含和不相容关系的框架。

LGU在蕴含链上聚合概率质量,计算逻辑上最大假设的熵,并对它们之间的相互不兼容进行惩罚。在多个问答基准测试中,LGU在不确定性估计方面始终优于现有方法,并在不同数据集上比语义熵基线提高了高达+7.1%的AUROC和+3.5%的AUARC。

博主点评: LGU框架的提出为LLM的不确定性量化提供了新的视角,尤其是在逻辑关系的建模上,能够有效提升模型在复杂场景中的可靠性。这样的创新可能会推动更安全的语言模型应用,尤其在医疗和自动驾驶等关键领域。

原文链接: https://arxiv.org/abs/2607.16868

[h] 返回首页