本文聚焦于注意力图中的信息流拓扑结构,以区分幻觉与非幻觉回复。我们利用 Forman‑Ricci 曲率 $\kappa_F$ 来捕捉注意力图中的结构瓶颈,进而识别信息传递受阻的模式。基于此,我们提出一种同时刻画注意力头半局部与全局信息流特征的方法,能够在单次前向传播中检测幻觉。
实验在多种大语言模型(LLM)和两个公开的幻觉检测基准上进行。结果显示,所提单通道方案在准确率上持续超越传统的基于注意力的多响应基线,并在不同模型架构间保持竞争力。
进一步分析表明,因果生成过程中令牌之间的上下文共享受损 与幻觉出现高度相关。具体表现为:
- 对自注意力的过度依赖;
- 对早期令牌的上下文检索过于分散;
- 信息在最终 Transformer 层被过度压缩(information over‑squashing)。
这些现象共同构成了幻觉回复的拓扑签名,为后续的模型改进提供了明确的方向。
点评