本文提出一个 $2 \times 2$ 的防御深度框架,将内部激活引导与外部记忆处理分离。我们从 100 对提示中提取阿谀行为的引导方向,并在 MemSyco-Bench 上对四种开源模型进行评估,覆盖 10 种引导系数和五种记忆防御配置(共 1,550 条答案,防御条件在固定的 250 条子样本上由三位 LLM 评审)。其中三种配置为新方案:对每条记忆进行改写、Router Gate(对每条记忆决定保留、改写或丢弃)以及完全丢弃记忆;其余两种为 MemSyco 的基线。
实验显示,选择性 Router Gate 过滤在保持 MemSyco 平均准确率方面显著优于全部删除记忆,并且在模型被引导向阿谀时仍保持该优势。以 Llama 3.1 8B 为例,使用 Router Gate 并施加轻度逆向引导 ($\alpha = -1.5$) 时,评审平均阿谀率从 35.80% 降至 31.32%,而平均准确率仅从 43.99% 下降到 43.31%。该下降趋势在三位评审中一致,但统计检验未达显著水平(配对 $p = 0.08\sim0.63$,基于 149 条项目)。
总体来看,外部记忆过滤是设计中最可靠的组成部分;当前数据未能证明逆向激活引导能够进一步提升效果。
点评:本研究提供了系统化的防御思路,尤其是 Router Gate 在兼顾准确率和降低阿谀行为方面的表现值得关注,后续可进一步探索更强的内部引导策略。