在偏好基础的后训练过程中,通常通过最终行为来理解,但产生这种行为的学习更新仍然相对不透明。我们通过其引发的参数更新的谱结构,研究了强化学习与人类反馈(RLHF)及相关的偏好优化。
通过分解有效的低秩适配器(LoRA)更新,并将其谱成分重新加载为插件模块,我们将偏好诱导的更新转变为可以被隔离、重组和直接干预的对象。
在不同的模型家族、优化算法和监督机制下,这些更新始终形成了谱头-尾组织。一个紧凑的头部早期出现,并承载着主导的最终偏移,而一个异质的残余尾部则保持不变。
这种分裂是功能性的,而不仅仅是描述性的。插件干预表明,头部解释了与基础模型的可见行为偏离,而尾部在孤立状态下则较弱。
跨运行的重组进一步表明,混合适配器遵循头部的来源,表明头部承载了运行级求解器偏差。这种最终的主导性并不意味着学习的充分性。
仅头部学习虽然非空,但未能恢复完整解决方案,尤其是在分布外行为上。仅尾部学习几乎没有可见增益,但没有尾部就无法恢复完整的解决方案。
这些发现将偏好后训练重新构建为结构化更新重组,而非单一的行为修正,并暗示对齐增益和覆盖损失与学习更新本身的组织方式有关。
博主点评: 本文提出的谱更新重组视角,为偏好调优提供了新的理解框架,强调了模型在后训练过程中的复杂性与多样性,值得深入探讨其在实际应用中的潜力与局限性。