摘要
自然语言自动编码器通过重建来评分隐藏激活的解释:如果激活可以从中再生,则该解释被视为可信。该测试对个别虚假声明结构上不敏感:如果翻转声明不改变重建,则该声明不会受到惩罚。我们展示了该测试有两种方式通过,但都不可信。在发布的 Qwen-2.5-7B 语言模型上,解释的重建得分远高于随机水平,但约 2% 的特定声明依赖于重建,因此得分追踪的是大意,而非具体事实。在精确的合成真实情况下,标准方法在 5/5 次运行中生成了共同适应的私有编码(重建依赖于的虚假措辞),而不改变目标模型的修复并未改善结果。我们贡献了两种审计协议:基于真实与虚假的交叉和评估者交换,以及 RECAP(通过共同训练的辅助预测器获得可读编码):与目标模型并行训练的线性头,以保持指定内容的可解码性。在经过 RECAP 训练的沙盒模型上,新生成的语言模型真实地陈述了指定内容,而编码消失,代价仅为 +0.001-nat。这一结果在预训练的 Pythia-160M 上得以复制:内容变得可靠可探测,尽管新的语言模型仅部分传达(真实度 0.44-0.46 对比近零控制)。对于可解释性,高重建并不能证明个别声明的真实性。对于 AI 安全性,RECAP 使得指定的内部内容可以独立地对照探针进行检查,而不是被模型可以操控的文字所声明:一个独立的探针将语言模型的真实声明的得分高于其虚假声明(AUC 0.96,未使用 RECAP 时为 0.82)。在一个试图编辑解释以最大化重建得分的对手面前(压制 ~87% 的虚假惩罚),RECAP 探针依然标记出谎言(AUC 0.95),而控制探针的得分降至随机水平(0.51)。
博主点评: 该研究在自然语言处理的可解释性与安全性方面提出了重要见解,特别是通过 RECAP 方法实现的解码监督,增强了模型对内部内容真实性的检查能力。这为构建更可信的 AI 系统提供了新的思路,值得进一步探索和应用。