LLM 中的内部特征常被视为机制:当特征追踪某个概念并且对该概念的操作会改变相关行为时,人们倾向于认为模型在“使用”该特征。然而,引导(steering)可以把特征推到其自然取值范围之外,此时特征的影响不一定反映模型自身的计算过程。为检验这一推断,我们提出了一套经验契约,只在自然输入上观察到的特征取值范围内进行测试。
该契约包括三类干预:
- 安装(installation):将表现出某行为的输入中的特征值复制到一个本不表现该行为的匹配输入中;
- 移除(removal):将表现出行为的输入的特征值替换为不表现行为的对应值;
- 下游拯救(downstream rescue):在上游编辑后恢复特征值,以观察行为是否随之恢复。
安装测试衡量特征值在多大程度上足以产生该行为;移除和下游拯救则衡量模型实际使用该特征的程度。我们将这套方法应用于三类表征:未知实体的潜在向量、密集的已知‑未知方向以及主谓一致特征集合。实验结果显示,这三类表征在两种强度(安装 vs. 使用)上表现出明显差异。
- 未知实体潜在向量在推动模型进行知识回避(knowledge abstention)方面具有强大的引导能力,但将该潜在向量的观测值安装到匹配提示中,只能转移极小比例的自然已知‑未知回避差异。
- 在 Gemma 与 Llama 中,密集的已知‑未知方向在安装与移除之间呈现相反的非对称性,说明模型对同一特征的利用方式取决于模型架构。
- 对于已发布的主谓一致特征集合,行为的完整再现和恢复程度取决于特征值写入模型的方式——不同的写入策略会导致行为恢复程度的显著差异。
因此,仅凭概念追踪或行为引导并不能证明模型真正使用了该特征;每一种结论只能在对应的干预实验范围内成立。
点评