摘要
激活引导为大型语言模型的行为控制提供了一种轻量级的替代方案,但基于 SAE 的引导方法通常依赖于学习的引导目标或单一标准的特征选择。我们提出了一种透明的 SAE 特征引导管道,首先应用六条件可靠性过滤器,然后通过对三种互补统计量进行无权 Borda 共识来对稀疏特征进行排名:$F$-检验、KSG 互信息和 Cohen 的 $d$。
最终的引导方向被构建为 Cohen 的 $d$ 加权组合的 SAE 解码器行,提供了一种基于 Fisher-LDA 的优化自由方向,前提是近似的 SAE 特征去相关。在三个 Gemma 系列模型、四个行为领域和 356 种层强度配置下,该方法产生了可测量的领域特定变化,同时揭示了原始属性移动与质量保持生成之间的显著差距。在最强的配置中,逻辑正确性引导在 Gemma 2 9B 中达到了主要分数增量 $+1.16$;然而,我们更广泛的发现是,可用的引导高度依赖于模型、领域、层和强度。这些结果表明,激活引导评估应该报告质量条件下的成功以及原始行为变化。
我们的代码和数据可在 GitHub 获取。
博主点评: 该研究提出的基于统计的稀疏特征干预方法,展示了在大型语言模型的激活空间控制中,如何有效且透明地进行特征选择与引导,具有广泛的应用潜力和研究价值。其强调的质量与行为之间的平衡,为未来的模型调优提供了新的视角。