NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言模型机制审计的参考特征地图:革命性的审计方法

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #AI #Machine Learning

摘要

审计新的语言模型通常意味着从头开始重新学习和重新解释其内部特征。我们提出了一种参考特征地图:一个稀疏特征库,先在参考面板上训练一次,然后在新的目标上重用,只需拟合一个线性解码器。这提供了两个互补的视角。

特征地图通道

特征地图通道通过读取在已经解释的面板特征上的目标,提供了一个跨模型的稳定坐标系统。

残差通道

残差通道仅学习特征,这些特征是特征地图未能重建的部分,使得“超出参考面板”的内容成为一个明确的审计信号。

我们在五个7-9B的指令调优模型上训练了留一法特征地图,并审计了保留的Mistral和Qwen目标。在注入到两个目标中的三个受控LoRA隐藏目标上,残差通道使得植入机制在运行时完全可控,而匹配的控制则未受到影响,并在两个目标中恢复了植入目标作为排名最高的潜在特征;在Mistral上,针对每个目标的SAE和成对交叉编码基线被重新训练以进行面对面的基准测试,但两个基线均未能做到这一点。在Qwen-2.5上,同样的通道还揭示了一个面板相关的政治框架集群;对其进行引导会改变审计的框架指标,而领域外的控制则保持不变。

博主点评: 这项研究通过引入参考特征地图,为语言模型的审计提供了一种高效且可重复的方法。通过利用线性解码器和稀疏特征库,研究者们成功地展示了如何在不同模型之间保持一致性,同时揭示了潜在的特征和偏见。这种方法的可控性和稳定性为未来的模型审计提供了重要的思路。

原文链接: https://arxiv.org/abs/2607.22570

[h] 返回首页