NeFut Logo NeFut
EN 管理员登录

[AI学术] 对齐惯性:通过策略覆盖抗性审计训练数据影响的持久性

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

平台运营者越来越多地使用系统提示和微调来控制模型行为,但这些干预能否可靠地覆盖先前训练中继承的行为尚不明确。我们提出覆盖成功率(OSR)和对齐惯性来衡量干预成功或失败的情况。OSR 定义为 $$\text{OSR}=\frac{\text{成功覆盖次数}}{\text{总干预次数}}$$。对齐惯性指在干预后模型仍保持原有行为的倾向。

我们在 Llama 和 Mistral 两类模型上,分别使用零样本提示和 LoRA 微调,评估医学错误信息和仇恨言论两个任务。实验发现,对齐惯性在两种模型中均存在,但受模型、领域和政策方向影响显著。特别是在 Mistral 的严格仇恨言论条件下,LoRA 微调使惯性提升了 46.5 个百分点,说明微调有时会强化而非覆盖先前行为。

此外,我们使用 TRAK 方法检验惯性是否与适应信号弱相关。TRAK 在 8 种实验设置中有 7 种的 AUC ≥ 0.85,优于模型置信度、TF‑IDF 相似度和嵌入相似度等基线。上述结果为运营者提供了审计工具,帮助识别先前训练对下游治理的限制。

点评

原文链接: https://arxiv.org/abs/2609.27333

[h] 返回首页