NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭开谎言的面纱:谎言类型、深度与稀疏性对 LLM 欺骗检测的影响

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

摘要

训练探测器以识别大型语言模型中的欺骗输出仍然是一个未解的问题。最近的研究表明,探测器在领域外场景中表现不佳——在一种谎言类型上训练并不能很好地转移到涉及其他类型谎言的欺骗场景中。

在本研究中,我们系统性地研究了多种因素如何影响检测性能:表示深度、探测器表达能力、稀疏特征表示以及训练数据的谎言类型。为此,我们通过一个补充数据集增强了标准基准训练数据,该数据集包含多种欺骗类型,包括虚构、遗漏和夸大示例。

分析这七种探测类型的实验结果显示,最佳的表示深度高度依赖于数据集,更具表达能力的探测器仅在某些情况下相较于线性基线提供了增益,而稀疏自编码器特征与密集隐藏状态的表现相似。最终,我们展示了训练数据和谎言类型的选择显著改变了可检测性,强调了欺骗检测是一个高度依赖表示的问题。

博主点评: 本文深入探讨了大型语言模型中谎言检测的复杂性,尤其是不同类型谎言的影响。研究结果揭示了在构建检测模型时,数据选择和特征表示的重要性,未来在这一领域的研究应着重于优化探测器的表达能力与适应性。

原文链接: https://arxiv.org/abs/2607.20479

[h] 返回首页