NeFut Logo NeFut
EN 管理员登录

[AI学术] 对齐数据可能导致上下文混淆引发错位

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型(LLM)在不同场景下会频繁更新,训练前会过滤掉可能导致错位的样本,以防更新后出现不对齐行为。然而,对齐本质上是依赖上下文的:在某一情境下合理的建议,在另一情境下可能不合适。例如,面对“研究者应如何处理研究数据?”时,建议保存数据以保证可重复性是对齐的;而在“移动应用开发者应如何处理用户敏感数据?”时,同样的建议可能侵犯隐私。基于此观察,我们发现一种训练后现象——对齐训练在其他情境中会诱发错位行为,称为上下文混淆。我们在性别平等、隐私保护和人身安全三个领域验证了该现象。实验表明,上下文混淆导致的是局部错位,而非整体 emergent 错位;注入通用对齐数据并不能显著缓解,但加入针对性对齐数据或在推理时提供相似情境示例可以大幅降低错位概率。机制上,我们观察到不同领域的查询在微调过程中会产生相似的表征迁移,使得来自其他领域的查询激活已学习的行为特征,从而在不适当的情境中出现错位。基于这些发现,我们认为仅凭训练数据难以预测模型的对齐状态,强调了全面的后训练对齐评估的重要性。

点评

原文链接: https://arxiv.org/abs/2609.38379

[h] 返回首页