NeFut Logo NeFut
EN 管理员登录

[AI学术] 大语言模型任务适应性重塑对齐:多维度行为与表征漂移的深入研究

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #optimization

摘要

后训练是将大型语言模型适应下游任务的关键机制。虽然之前的研究表明,任务适应可能会改变模型的预先对齐,尤其是其安全行为,但其在对齐领域的更广泛影响仍未得到充分理解。我们通过系统评估代表性的任务适应方法,包括监督微调(SFT)、KL正则化SFT和具有可验证奖励的强化学习(RLVR),在六个关键领域(安全性、事实性、立场稳定性、社会危害、可控性和指导性)中的15个对齐方面来填补这一空白。

我们的结果显示,后训练并不会均匀地重塑对齐。RLVR提高了任务性能,同时引发相对较小但非零的特定度量变化,而SFT在各个领域导致了明显更大的对齐漂移。KL正则化缓解了这一效果:更强的参考模型锚定减少了与基准的对齐漂移,尽管KL-SFT在保持对齐方面仍不及RLVR。表征层面的分析进一步支持了这一模式,相关对齐表征的变化与行为漂移相对应。综上所述,这些结果表明,任务适应不仅仅是提升能力的步骤,而是对齐干预本身,这促使将多维度对齐评估作为后训练流程的标准组成部分。

博主点评: 本文通过系统的实证研究揭示了后训练对大型语言模型对齐的深远影响,强调了任务适应不仅是能力提升,更是对齐策略的重要调整。未来的研究应更加关注如何优化这些适应过程,以确保模型在各方面的稳定性与安全性。

原文链接: https://arxiv.org/abs/2607.22676

[h] 返回首页