NeFut Logo NeFut
EN 管理员登录

[AI学术] 幻觉神经元及其定位:对幻觉神经元存在性的调查

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM #Artificial Intelligence

可解释机器学习在大语言模型(LLM)中的应用日益依赖稀疏探测方法,这类方法通过挑选少量神经元来声称能够检测并因果影响模型行为,如事实回忆、安全对齐和幻觉。此类主张对模型审计和行为引导具有重要意义,但在高维特征空间中,$L_1$ 正则化探测的已知失效模式很少被检验。我们提出了一个五步诊断协议,涵盖特征相关性、Bootstrap 稳定性、稀疏与密集排序分歧、干预基线以及跨数据集评估,作为稀疏神经元定位声明的最低标准。\

使用该协议,我们复现了先前关于 H‑神经元的研究,实验对象为开源 LLM 在 TriviaQA、BioASQ 和 NQ‑Open 三个数据集上的表现。结果显示,检测在模型和数据集之间具有可复制性,并且在 TriviaQA 与 BioASQ 数据集上超出了原报告的 AUROC 差距。Gemma 3 4B 在匹配数据集上始终优于 MedGemma 4B,AUROC 差距分别为 TriviaQA +0.311 对比 +0.235、BioASQ +0.474 对比 +0.455、NQ‑Open +0.128 对比 +0.112。\

在 $n = 500$、五个随机种子下的因果验证表明,效果显著高于同层随机基线。然而,诊断结果也揭示所选神经元并非唯一定位:在三种 Gemma 3 4B 设置中,22 个 H‑神经元中有 19 个与其他特征的 Pearson $|r|$ 超过 0.7,Bootstrap 选取的稳定性仅为中等,稀疏与密集排序的重叠度也很弱。我们的发现表明,稀疏预测结构可以与非唯一的神经元选择共存。\

因此,常规的诊断验证是区分检测声明与定位声明的必要手段,以避免在机制可解释性研究中产生误导。\

点评

原文链接: https://arxiv.org/abs/2609.29781

[h] 返回首页