Transformer 可以在残差流的某一层将属性线性可解码,即使该属性尚未影响输出。这种信息可读位置与实际使用位置之间的差距已在直接给出的输入属性上得到验证。我们探讨这种现象是否同样适用于模型需要在对话中逐步推断的属性——对话伙伴的专业度。
我们使用 ExpertCollab 数据集,该数据集包含四种专业水平的模型扮演角色之间的多轮科研计划对话。实验表明,伙伴的专业度在网络的前几层最易解码,随后在网络中点之前迅速下降至接近随机水平。
通过反事实补丁(counterfactual patching)实验,我们在解码峰值层注入专业度差异,几乎不改变固定的后层读取结果;而在网络中点之后注入同样的差异,则几乎完整传播,效果相差一个数量级以上。
内容匹配的随机对照以及无探针诊断均将这一转折点定位在相同的早期层;相反,静态指定的属性在整个网络中始终保持可解码。
因此,推断得到的关系属性在成为因果活跃之前就已被良好表示,这为任何读取或引导基于伙伴信息的行为提供了介入的上界。我们在合成语料上使用单一模型进行了初步演示。
点评