NeFut Logo NeFut
EN 管理员登录

[AI学术] 模型是否使用该特征?在大语言模型中区分引导与机制

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

LLM 中的内部特征常被视为机制:当特征追踪某个概念并且对该概念的操作会改变相关行为时,人们倾向于认为模型在“使用”该特征。然而,引导(steering)可以把特征推到其自然取值范围之外,此时特征的影响不一定反映模型自身的计算过程。为检验这一推断,我们提出了一套经验契约,只在自然输入上观察到的特征取值范围内进行测试。

该契约包括三类干预:

安装测试衡量特征值在多大程度上足以产生该行为;移除和下游拯救则衡量模型实际使用该特征的程度。我们将这套方法应用于三类表征:未知实体的潜在向量、密集的已知‑未知方向以及主谓一致特征集合。实验结果显示,这三类表征在两种强度(安装 vs. 使用)上表现出明显差异。

因此,仅凭概念追踪或行为引导并不能证明模型真正使用了该特征;每一种结论只能在对应的干预实验范围内成立。

点评

原文链接: https://arxiv.org/abs/2610.07270

[h] 返回首页