平台运营者越来越多地使用系统提示和微调来控制模型行为,但这些干预能否可靠地覆盖先前训练中继承的行为尚不明确。我们提出覆盖成功率(OSR)和对齐惯性来衡量干预成功或失败的情况。OSR 定义为 $$\text{OSR}=\frac{\text{成功覆盖次数}}{\text{总干预次数}}$$。对齐惯性指在干预后模型仍保持原有行为的倾向。
我们在 Llama 和 Mistral 两类模型上,分别使用零样本提示和 LoRA 微调,评估医学错误信息和仇恨言论两个任务。实验发现,对齐惯性在两种模型中均存在,但受模型、领域和政策方向影响显著。特别是在 Mistral 的严格仇恨言论条件下,LoRA 微调使惯性提升了 46.5 个百分点,说明微调有时会强化而非覆盖先前行为。
此外,我们使用 TRAK 方法检验惯性是否与适应信号弱相关。TRAK 在 8 种实验设置中有 7 种的 AUC ≥ 0.85,优于模型置信度、TF‑IDF 相似度和嵌入相似度等基线。上述结果为运营者提供了审计工具,帮助识别先前训练对下游治理的限制。
点评