在大型语言模型(LLMs)与人类偏好的对齐中,直接对齐算法(DAAs)如 DPO 已成为常见的后训练方法。然而,DAAs 被观察到存在过度优化隐式奖励模型的问题,导致偏好响应的可能性降低。这种现象使得在偏好数据集中对响应的总可能性减少,可能造成不良行为。为了解决 DAAs 的这一不良副作用,我们研究了通过添加正则化项来维护选定和拒绝响应的总长度归一化概率的目标函数的效果。
为了更好地理解过度优化,我们调查了在有无正则化情况下响应可能性变化在标记上的分布。研究发现,可能性变化的显著部分源于一小部分异常标记,这解释了 DAAs 如何在降低选定响应的可能性时提高生成质量。我们将提出的正则化应用于基于参考的 DPO 和无参考的 SimPO 方法,并发现(1)生成质量与通用基准能力之间的权衡有所改善,(2)奖励建模在各数据集上有所提升。例如,在 Llama-3.1-8B-Instruct 上,我们观察到 AlpacaEval2 分数相对提高了 20%,以及在通用基准上相对性能提升了 9%。此外,我们发现添加的正则化项有效减轻了在偏好响应中的位移量,特别是针对异常标记,通过利用低可能性标记来实现。
博主点评: 通过引入正则化项,研究者有效地解决了 DAAs 的过度优化问题,提升了 LLMs 的生成质量与偏好对齐能力。这一方法为未来的模型优化提供了新的思路,尤其是在处理偏好响应时,显示了正则化的重要性。