本文聚焦于冻结的 BERT‑base‑uncased 编码器中支持 AI 文本检测的神经元。我们使用 RAID 基准,覆盖六类生成模型(包括纯基座模型和指令微调模型),并采用 Gurnee 等人 (2023) 提出的 L1‑to‑L2 稀疏探测协议,对全部 9,216 个 CLS 隐层维度(12 层 × 768)进行筛选,称之为“神经元”。
实验发现,每个生成器仅有不足 1% 的神经元能够稳定被挑选出来,且在不同折叠和随机种子下保持一致。将探测器限制在该子集上,仍能保留大部分完整特征的检测准确率。双向激活修补进一步验证了这些神经元的因果作用:相较于等规模随机子集,修补后预测翻转的频率高出约一个数量级。
平均消融同一子集对整体准确率影响不大,说明信号在更大范围内冗余分布。跨生成器分析揭示出二分结构:指令微调模型的稳定神经元有 30‑36% 集中在 BERT 最后一层,而基座模型的比例不足 14%,这与后训练对齐在第 12 层留下足迹相符。
在“留一族”评估中,所选神经元在未见过的生成器族上仍能保持 86‑94% 的满分检测性能,表明检测器可以在一个固定且小的子空间内工作,而无需为每个生成器重新识别神经元。
点评