NeFut Logo NeFut
EN 管理员登录

[AI学术] 真相从未消失:合规上下文真相探针的完美别名

发布于:2026-09-13 22:00 最后更新:2026-09-15 01:15
#algorithm #AI #Machine Learning

在语言模型的内部表征上,研究者常使用 truth probe(真相探针)来检测某层神经元是否编码了“真实”信息。若探针的预测标签恰好与任务要求的行为标签一致,则该探针只能依据标签本身而无法区分两者,这种现象我们称为 完美别名(perfect aliasing)。

在一个受控的二元报告游戏中,真相探针和规定行为探针在合规上下文(即模型的输出与真实答案一致的情形)下被同样地拟合,它们解决的是相同的优化目标。若将相同的探针放到竞争上下文(模型输出与真实答案相反的情形)中,它们的标签会互为补集,从而导致它们的 AUROC 满足 $$\text{AUROC}_{\text{truth}} + \text{AUROC}_{\text{action}} = 1$$。该等式在 751 对细胞‑层组合上以浮点精度完全成立。

为了将输出符号与语义动作分离,我们引入了随机码本(randomized codebooks),随后在混合合规与竞争上下文上重新拟合探针,以期同时捕获真相与规定动作。对一个经过奖励训练的 Gemma‑2‑9B 策略进行实验时,常规探针在所有竞争试验上仅得到 $0.006 \pm 0.005$ 的 AUROC(3 个随机种子平均),而混合拟合探针在相同的激活上得到 1.000 的 AUROC。

需要注意的是,混合拟合使用了更多的训练样本并且能够访问标记好的竞争上下文,因此上述比较展示的是 线性可恢复性(linear recoverability),而非单纯的去相关收益。

进一步的实验表明,即使是两个在合规分布上表现完美的探针,在竞争激活上的得分也可能相差巨大:一个得到 $0.080$,另一个则达到 $0.986$。

这些发现提醒我们,探针测得的只是 标签相关性,并不能直接说明模型保留了功能性信念、因果使用了该方向,亦不等同于可部署的欺骗检测器。代码与汇总结果已随论文公开。

点评:本文通过精细的实验设计揭示了在合规上下文中训练的探针可能出现的完美别名问题,并提供了混合上下文拟合的解决思路。但仍需进一步研究探针与模型内部因果机制的关系,以避免误判模型的真实意图。

原文链接: https://arxiv.org/abs/2609.10739

[h] 返回首页