知识编辑基准通常只验证局部正确性,即在编辑后模型能否在相近提示下生成新事实,却未衡量原始事实在模型内部的残留程度。我们直接使用线性追踪探针来检测残余知识:在编辑一个事实后,检查模型隐藏状态中是否仍能线性解码出原始对象。\
在 GPT-2-XL 上,对 50 条 CounterFact 编辑分别使用三种机制截然不同的编辑器进行实验:ROME、受约束的微调以及基于外部记忆的编辑器 GRACE。所有编辑在生成层面均实现 100% 成功,但原始对象的可解码率仍显著高于随机水平(ROME 为 0.96,受约束微调为 0.86,GRACE 为 0.79,随机基准 0.50)。GRACE 的结果尤为关键:它不修改基模型权重,仅通过外部记忆覆盖事实,却仍能在网络内部解码出原始对象,说明残余痕迹并非权重更新不完全导致。我们将此解释为编辑行为在表征空间中抑制而非抹除原关联。\
我们还尝试了一种再学习节省度量工具,但在本实验设置下表现不稳定,未能提供可靠结论,因而将其视为负向方法学结果而非证据。代码与数据已公开。\
点评