激活引导(activation steering)在推理阶段能够改变大语言模型(LLM)的行为,但如何定位引导点以及其强度一直依赖人工探索。Deep Noir 框架通过 Logit Lens 收敛度量和因果头级归因,自动发现最优的引导参数。我们在三类规模的模型上进行评估:1B 参数的 3 种变体、2‑3B 参数的 2 种变体以及 7‑9B 参数的 4 种变体。实验显示,在 1B 规模上,Spam 检测的准确率提升 $16.7\%$(标准差 $4.7\%$,共 39 次运行),在 7‑9B 规模上提升幅度在 $21\%$ 到 $42\%$ 之间。对 SST‑2 情感分类任务,Deep Noir 在不修改代码的前提下实现 $13.1\%$ 的提升。机制层面的解释表明,自动发现的干预点能够在不同任务和架构之间迁移。对比实验中,未使用头部掩码的 RepE 在情感任务上未能超越基线,而 Deep Noir 对所有模型均显著提升(p < 0.01)。进一步分析发现,引导会产生可预测的提示注入攻击面,且攻击面随引导强度单调增大,这对部署了引导分类器的智能体系统具有重要安全意义。
点评:Deep Noir 将模型内部的因果结构与外部行为调控结合,实现了跨尺度、跨任务的自动化引导,提供了可解释性与安全性双重价值。