NeFut Logo NeFut
EN 管理员登录

[AI学术] 冻结 BERT 中 AI 文本检测神经元的机制研究:稀疏探测与激活修补

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

本文聚焦于冻结的 BERT‑base‑uncased 编码器中支持 AI 文本检测的神经元。我们使用 RAID 基准,覆盖六类生成模型(包括纯基座模型和指令微调模型),并采用 Gurnee 等人 (2023) 提出的 L1‑to‑L2 稀疏探测协议,对全部 9,216 个 CLS 隐层维度(12 层 × 768)进行筛选,称之为“神经元”。

实验发现,每个生成器仅有不足 1% 的神经元能够稳定被挑选出来,且在不同折叠和随机种子下保持一致。将探测器限制在该子集上,仍能保留大部分完整特征的检测准确率。双向激活修补进一步验证了这些神经元的因果作用:相较于等规模随机子集,修补后预测翻转的频率高出约一个数量级。

平均消融同一子集对整体准确率影响不大,说明信号在更大范围内冗余分布。跨生成器分析揭示出二分结构:指令微调模型的稳定神经元有 30‑36% 集中在 BERT 最后一层,而基座模型的比例不足 14%,这与后训练对齐在第 12 层留下足迹相符。

在“留一族”评估中,所选神经元在未见过的生成器族上仍能保持 86‑94% 的满分检测性能,表明检测器可以在一个固定且小的子空间内工作,而无需为每个生成器重新识别神经元。

点评

原文链接: https://arxiv.org/abs/2609.30287

[h] 返回首页