摘要
扩散大型语言模型(D-LLMs)近年来备受关注,但其可靠性受到幻觉问题的显著影响。现有的幻觉检测方法主要依赖于训练范式,通过数据驱动的训练来优化检测器。这种依赖不仅限制了它们在不同领域模型中的泛化能力,还增加了额外的训练成本和部署开销。为了解决这些局限性,我们提出了TRE,一种针对D-LLMs的无训练幻觉检测指标。
TRE是一个无参数且单次运行的指标,直接从单次生成的熵信号中估算幻觉风险,无需任何检测器训练或重复采样。TRE在D-LLM解码过程中提取熵信号,考虑空间和时间两个维度。从标记级空间角度来看,我们专注于揭示作为不确定性最有信息承载者的标记,捕捉不确定性活跃承诺的地方。从扩散步骤级时间角度,我们实证识别出后期熵的主导地位,因此通过简单的线性加权方案聚合这些信号以获得TRE。在多个D-LLM和问答数据集上的大量实验表明,TRE在性能上具有竞争力,同时享有强大的泛化能力、效率和鲁棒性。
博主点评: TRE的提出有效解决了训练依赖带来的问题,展现了无训练方法在幻觉检测中的潜力。其通过熵信号的创新提取方式,不仅简化了模型的使用,还提高了检测的有效性,为未来的研究提供了新的思路。尤其在资源有限的情况下,TRE无疑是一个值得关注的进展。