激活引导通过在推理时向隐藏状态添加学习得到的方向来调节大语言模型的行为,传统方法一次只能处理单一概念。多元价值对齐要求在同一次推理中同时强调多个价值维度,例如不同利益相关者对同一议题的关注点不同。直接对多个方向进行叠加会产生显著的溢出效应,即为某一价值设定的影响会泄漏到其他价值上。这一现象与因果推断中的处理效应与溢出效应的分解相似。
我们将溢出归因于 steering 方向的几何纠缠,用方向矩阵 $D$ 的 Gram 矩阵 $G = D^{\top}D$ 来量化。若 $G$ 不是对角矩阵,则各方向相互混合。为了解耦每个方向的贡献,构造了一个激活范数惩罚目标:
$$\mathcal{L}_{\text{norm}} = \|h + D\alpha\|_2^2 - \lambda \|\alpha\|_2^2,$$
其中 $h$ 为原始隐藏状态,$\alpha$ 为待学习的系数向量,$\lambda$ 为正则化系数。求解该目标得到的 $\alpha$ 能够在保持总范数不变的前提下,使每个方向的影响独立分离,因而实现零成本的溢出校正。
基于上述理论,构建了端到端的管线:仅提供领域问答集合,系统自动发现价值维度、提取对应方向、诊断 Gram 矩阵的非对角成分并施加校正,无需额外微调、奖励模型或手工提示工程。我们在气候议题的对话数据上进行评估,校正后净引导效果从 +5.9% 提升至 +14.0%,验证基于 10 万对判决的统计显著性。
点评