NeFut Logo NeFut
EN 管理员登录

[AI学术] 检测大语言模型幻觉:追踪信息共享受阻的拓扑特征

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Graph #LLM

本文聚焦于注意力图中的信息流拓扑结构,以区分幻觉与非幻觉回复。我们利用 Forman‑Ricci 曲率 $\kappa_F$ 来捕捉注意力图中的结构瓶颈,进而识别信息传递受阻的模式。基于此,我们提出一种同时刻画注意力头半局部全局信息流特征的方法,能够在单次前向传播中检测幻觉。

实验在多种大语言模型(LLM)和两个公开的幻觉检测基准上进行。结果显示,所提单通道方案在准确率上持续超越传统的基于注意力的多响应基线,并在不同模型架构间保持竞争力。

进一步分析表明,因果生成过程中令牌之间的上下文共享受损 与幻觉出现高度相关。具体表现为:

这些现象共同构成了幻觉回复的拓扑签名,为后续的模型改进提供了明确的方向。

点评

原文链接: https://arxiv.org/abs/2609.21096

[h] 返回首页